Skip to main content
A conversão de fala para texto transcreve áudio falado em texto escrito. Envie um arquivo de áudio para /audio/transcriptions, escolha um modelo de transcrição e selecione o formato de resposta desejado. Trabalhando com a gravação de uma conversa? Notas de Reunião com Fala para Texto vai de um arquivo de áudio a decisões e itens de ação que citam o segundo em que foram acordados, incluindo quais modelos retornam os tempos dos segmentos e como lidar com uma transcrição que nunca diz quem está falando.

Uso Básico

Entradas Suportadas

Os formatos de áudio suportados são wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga e webm. Um arquivo é aceito quando seu tipo MIME ou sua extensão está nessa lista, e os bytes enviados também precisam passar em uma verificação de magic bytes — renomear um arquivo para uma extensão suportada não fará com que ele passe. Consulte a página Modelos de Fala para Texto para saber quais modelos são suportados atualmente e seus preços.

Formatos de Resposta

Esses são os únicos dois valores que response_format aceita. Não existe a opção srt, vtt ou verbose_json — solicitar uma delas retorna um 400. Para criar legendas, use timestamps: true com response_format: json e renderize os dados de tempo você mesmo.

Timestamps

Passe timestamps=true para receber dados de tempo junto com a transcrição. O suporte é específico de cada modelo, e a granularidade difere:
O modelo padrão, nvidia/parakeet-tdt-0.6b-v3, aceita timestamps=true e depois o ignora — você recebe uma resposta contendo apenas text, sem erro e sem aviso. Escolha um modelo da tabela acima se precisar de tempos, e verifique se a chave timestamps existe antes de lê-la.
Modelos com granularidade de segmento retornam um array segment em vez disso, onde cada entrada é { "text": "...", "start": 0.0, "end": 3.2 }. Todos os tempos estão em segundos.
Nenhum modelo de transcrição da Venice realiza diarização de falantes, então não há campo speaker em nenhuma resposta. Uma transcrição é um fluxo único de texto — falantes só podem ser atribuídos quando um nome é dito em voz alta.

Dicas de Produção

  • Mantenha o áudio nítido e evite falas sobrepostas quando possível.
  • Divida gravações muito longas em pedaços menores se seu fluxo de trabalho precisar de menor latência ou retentativas mais fáceis.
  • Armazene o caminho do áudio original, o ID do modelo e o formato de resposta com cada transcrição para fins de auditoria.

Recursos Relacionados