Usa il valore
id come parametro model nelle richieste API. 5 modelli attualmente disponibili.Utilizzo
I modelli speech-to-text trascrivono l’audio parlato in testo scritto. Si accede tramite l’API Audio Transcriptions.Formati audio supportati
wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm
Un file è accettato quando il suo MIME type o la sua estensione è in questa lista, e deve anche superare un controllo dei magic byte sui byte caricati. Rinominare un file con un’estensione supportata non è sufficiente.
Formati di risposta
Timestamps
Impostatimestamps: true per ricevere i dati di timing insieme alla trascrizione. La risposta aggiunge un oggetto timestamps la cui granularità dipende dal modello:
Le voci word sono
{ "word": "...", "start": 0.0, "end": 0.5 } e le voci segment sono { "text": "...", "start": 0.0, "end": 3.2 }, con tutti i tempi in secondi.
I prezzi sono fatturati per secondo di audio in input. Consulta l’API Audio Transcriptions per esempi di richiesta e dettagli sui parametri.