Skip to main content
Use o valor id como o parâmetro model nas requisições à API. 5 modelos disponíveis atualmente.

Uso

Modelos de fala para texto transcrevem áudio falado em texto escrito. Eles são acessados pela API de transcrições de áudio.

Formatos de áudio suportados

wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm Um arquivo é aceito quando seu tipo MIME ou sua extensão está nesta lista, e ele também precisa passar em uma verificação de magic bytes sobre os bytes enviados. Renomear um arquivo para uma extensão suportada não é suficiente.

Formatos de resposta

Timestamps

Defina timestamps: true para receber dados de tempo junto com a transcrição. A resposta adiciona um objeto timestamps cuja granularidade depende do modelo:
nvidia/parakeet-tdt-0.6b-v3 é o modelo padrão, e ele aceita timestamps: true sem retornar tempos. Não há erro nem aviso — a resposta simplesmente contém text e nada mais. Se você precisar de tempos, escolha um modelo da tabela acima e verifique se a chave timestamps está presente antes de lê-la.
Entradas de palavra são { "word": "...", "start": 0.0, "end": 0.5 } e entradas de segmento são { "text": "...", "start": 0.0, "end": 3.2 }, com todos os tempos em segundos.
A cobrança é por segundo de áudio de entrada. Veja a API de transcrições de áudio para exemplos de requisição e detalhes dos parâmetros.