Usa el valor
id como parámetro model en las solicitudes a la API. Actualmente hay 5 modelos disponibles.Uso
Los modelos de voz a texto transcriben audio hablado en texto escrito. Se acceden mediante la API de transcripciones de audio.Formatos de audio admitidos
wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm
Un archivo se acepta cuando su tipo MIME o su extensión están en esta lista, y además debe superar una comprobación de magic bytes sobre los bytes subidos. Renombrar un archivo con una extensión admitida no es suficiente.
Formatos de respuesta
Marcas de tiempo
Establecetimestamps: true para recibir datos de tiempo junto con la transcripción. La respuesta añade un objeto timestamps cuya granularidad depende del modelo:
Las entradas de palabra son
{ "word": "...", "start": 0.0, "end": 0.5 } y las entradas de segmento son { "text": "...", "start": 0.0, "end": 3.2 }, con todos los tiempos en segundos.
La facturación es por segundo de audio de entrada. Consulta la API de transcripciones de audio para ejemplos de solicitud y detalles de parámetros.