Skip to main content
La voz a texto transcribe audio hablado a texto escrito. Envía un archivo de audio a /audio/transcriptions, elige un modelo de transcripción y selecciona el formato de respuesta que deseas recibir. ¿Trabajas con la grabación de una conversación? Notas de reunión con voz a texto va de un archivo de audio a decisiones y elementos de acción que citan el segundo en que se acordaron, incluyendo qué modelos devuelven tiempos de segmento y cómo manejar una transcripción que nunca dice quién está hablando.

Uso básico

Entradas admitidas

Los formatos de audio admitidos son wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga y webm. Un archivo se acepta cuando su tipo MIME o su extensión están en esa lista, y los bytes subidos también deben superar una comprobación de magic bytes: renombrar un archivo con una extensión admitida no bastará para que pase. Consulta la página de Modelos de Voz a Texto para conocer el soporte de modelos y precios actuales.

Formatos de respuesta

Estos son los únicos dos valores que acepta response_format. No existen las opciones srt, vtt ni verbose_json: solicitar una devuelve un 400. Para crear subtítulos, usa timestamps: true con response_format: json y renderiza tú mismo los datos de tiempo.

Marcas de tiempo

Pasa timestamps=true para recibir datos de tiempo junto con la transcripción. El soporte es específico de cada modelo, y la granularidad difiere:
El modelo predeterminado, nvidia/parakeet-tdt-0.6b-v3, acepta timestamps=true y luego lo ignora: recibes una respuesta que contiene solo text, sin error ni advertencia. Elige un modelo de la tabla anterior si necesitas datos de tiempo, y comprueba que la clave timestamps existe antes de leerla.
Los modelos de nivel de segmento devuelven en su lugar un arreglo segment, donde cada entrada es { "text": "...", "start": 0.0, "end": 3.2 }. Todos los tiempos están en segundos.
Ningún modelo de transcripción de Venice realiza diarización de hablantes, por lo que no hay campo speaker en ninguna respuesta. Una transcripción es un único flujo de texto: los hablantes solo pueden atribuirse cuando un nombre se dice en voz alta.

Consejos para producción

  • Mantén el audio claro y evita solapamientos entre hablantes cuando sea posible.
  • Divide las grabaciones muy largas en fragmentos más pequeños si tu flujo de trabajo necesita menor latencia o reintentos más sencillos.
  • Almacena la ruta original del audio, el ID del modelo y el formato de respuesta con cada transcripción para facilitar la auditoría.

Recursos relacionados