Use o valor
id como o parâmetro model nas requisições à API. 5 modelos disponíveis atualmente.Uso
Modelos de fala para texto transcrevem áudio falado em texto escrito. Eles são acessados pela API de transcrições de áudio.Formatos de áudio suportados
wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm
Um arquivo é aceito quando seu tipo MIME ou sua extensão está nesta lista, e ele também precisa passar em uma verificação de magic bytes sobre os bytes enviados. Renomear um arquivo para uma extensão suportada não é suficiente.
Formatos de resposta
Timestamps
Definatimestamps: true para receber dados de tempo junto com a transcrição. A resposta adiciona um objeto timestamps cuja granularidade depende do modelo:
Entradas de palavra são
{ "word": "...", "start": 0.0, "end": 0.5 } e entradas de segmento são { "text": "...", "start": 0.0, "end": 3.2 }, com todos os tempos em segundos.
A cobrança é por segundo de áudio de entrada. Veja a API de transcrições de áudio para exemplos de requisição e detalhes dos parâmetros.