/audio/transcriptions, elige un modelo de transcripción y selecciona el formato de respuesta que deseas recibir.
¿Trabajas con la grabación de una conversación? Notas de reunión con voz a texto va de un archivo de audio a decisiones y elementos de acción que citan el segundo en que se acordaron, incluyendo qué modelos devuelven tiempos de segmento y cómo manejar una transcripción que nunca dice quién está hablando.
Uso básico
Entradas admitidas
Los formatos de audio admitidos sonwav, wave, flac, m4a, aac, mp4, mp3, ogg, oga y webm. Un archivo se acepta cuando su tipo MIME o su extensión están en esa lista, y los bytes subidos también deben superar una comprobación de magic bytes: renombrar un archivo con una extensión admitida no bastará para que pase. Consulta la página de Modelos de Voz a Texto para conocer el soporte de modelos y precios actuales.
Formatos de respuesta
Estos son los únicos dos valores que acepta
response_format. No existen las opciones srt, vtt ni verbose_json: solicitar una devuelve un 400. Para crear subtítulos, usa timestamps: true con response_format: json y renderiza tú mismo los datos de tiempo.Marcas de tiempo
Pasatimestamps=true para recibir datos de tiempo junto con la transcripción. El soporte es específico de cada modelo, y la granularidad difiere:
segment, donde cada entrada es { "text": "...", "start": 0.0, "end": 3.2 }. Todos los tiempos están en segundos.
Ningún modelo de transcripción de Venice realiza diarización de hablantes, por lo que no hay campo
speaker en ninguna respuesta. Una transcripción es un único flujo de texto: los hablantes solo pueden atribuirse cuando un nombre se dice en voz alta.Consejos para producción
- Mantén el audio claro y evita solapamientos entre hablantes cuando sea posible.
- Divide las grabaciones muy largas en fragmentos más pequeños si tu flujo de trabajo necesita menor latencia o reintentos más sencillos.
- Almacena la ruta original del audio, el ID del modelo y el formato de respuesta con cada transcripción para facilitar la auditoría.