/audio/transcriptions, escolha um modelo de transcrição e selecione o formato de resposta desejado.
Trabalhando com a gravação de uma conversa? Notas de Reunião com Fala para Texto vai de um arquivo de áudio a decisões e itens de ação que citam o segundo em que foram acordados, incluindo quais modelos retornam os tempos dos segmentos e como lidar com uma transcrição que nunca diz quem está falando.
Uso Básico
Entradas Suportadas
Os formatos de áudio suportados sãowav, wave, flac, m4a, aac, mp4, mp3, ogg, oga e webm. Um arquivo é aceito quando seu tipo MIME ou sua extensão está nessa lista, e os bytes enviados também precisam passar em uma verificação de magic bytes — renomear um arquivo para uma extensão suportada não fará com que ele passe. Consulte a página Modelos de Fala para Texto para saber quais modelos são suportados atualmente e seus preços.
Formatos de Resposta
Esses são os únicos dois valores que
response_format aceita. Não existe a opção srt, vtt ou verbose_json — solicitar uma delas retorna um 400. Para criar legendas, use timestamps: true com response_format: json e renderize os dados de tempo você mesmo.Timestamps
Passetimestamps=true para receber dados de tempo junto com a transcrição. O suporte é específico de cada modelo, e a granularidade difere:
segment em vez disso, onde cada entrada é { "text": "...", "start": 0.0, "end": 3.2 }. Todos os tempos estão em segundos.
Nenhum modelo de transcrição da Venice realiza diarização de falantes, então não há campo
speaker em nenhuma resposta. Uma transcrição é um fluxo único de texto — falantes só podem ser atribuídos quando um nome é dito em voz alta.Dicas de Produção
- Mantenha o áudio nítido e evite falas sobrepostas quando possível.
- Divida gravações muito longas em pedaços menores se seu fluxo de trabalho precisar de menor latência ou retentativas mais fáceis.
- Armazene o caminho do áudio original, o ID do modelo e o formato de resposta com cada transcrição para fins de auditoria.