Lo speech-to-text trascrive l’audio parlato in testo scritto. Invia un file audio a /audio/transcriptions, scegli un modello di trascrizione e seleziona il formato di risposta desiderato.
Utilizzo di Base
I formati audio comuni includono mp3, mp4, mpeg, mpga, m4a, wav, webm, flac e ogg. Consulta la pagina Modelli Speech-to-Text per il supporto dei modelli e i prezzi aggiornati.
Formati di Risposta
Usa i formati per sottotitoli quando la trascrizione verrà abbinata a una riproduzione multimediale. Usa json o text quando la trascrizione alimenta riassunti, ricerca o prompt di chat a valle.
Consigli per la Produzione
- Mantieni l’audio chiaro ed evita, se possibile, la sovrapposizione tra parlanti.
- Suddividi registrazioni molto lunghe in chunk più piccoli se il tuo flusso richiede minore latenza o retry più semplici.
- Memorizza il percorso audio originale, l’ID del modello e il formato di risposta insieme a ogni trascrizione per esigenze di tracciabilità.
Risorse Correlate