Skip to main content
Usa el valor id como parámetro model en las solicitudes a la API. Actualmente hay 5 modelos disponibles.

Uso

Los modelos de voz a texto transcriben audio hablado en texto escrito. Se acceden mediante la API de transcripciones de audio.

Formatos de audio admitidos

wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm Un archivo se acepta cuando su tipo MIME o su extensión están en esta lista, y además debe superar una comprobación de magic bytes sobre los bytes subidos. Renombrar un archivo con una extensión admitida no es suficiente.

Formatos de respuesta

Marcas de tiempo

Establece timestamps: true para recibir datos de tiempo junto con la transcripción. La respuesta añade un objeto timestamps cuya granularidad depende del modelo:
nvidia/parakeet-tdt-0.6b-v3 es el modelo predeterminado, y acepta timestamps: true sin devolver datos de tiempo. No hay error ni advertencia: la respuesta simplemente contiene text y nada más. Si necesitas datos de tiempo, elige un modelo de la tabla anterior y comprueba que la clave timestamps está presente antes de leerla.
Las entradas de palabra son { "word": "...", "start": 0.0, "end": 0.5 } y las entradas de segmento son { "text": "...", "start": 0.0, "end": 3.2 }, con todos los tiempos en segundos.
La facturación es por segundo de audio de entrada. Consulta la API de transcripciones de audio para ejemplos de solicitud y detalles de parámetros.