Skip to main content
Usa il valore id come parametro model nelle richieste API. 5 modelli attualmente disponibili.

Utilizzo

I modelli speech-to-text trascrivono l’audio parlato in testo scritto. Si accede tramite l’API Audio Transcriptions.

Formati audio supportati

wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm Un file è accettato quando il suo MIME type o la sua estensione è in questa lista, e deve anche superare un controllo dei magic byte sui byte caricati. Rinominare un file con un’estensione supportata non è sufficiente.

Formati di risposta

Timestamps

Imposta timestamps: true per ricevere i dati di timing insieme alla trascrizione. La risposta aggiunge un oggetto timestamps la cui granularità dipende dal modello:
nvidia/parakeet-tdt-0.6b-v3 è il modello predefinito e accetta timestamps: true senza restituire i timing. Non c’è alcun errore né avviso — la risposta contiene semplicemente text e nient’altro. Se hai bisogno dei timing, scegli un modello dalla tabella qui sopra e verifica che la chiave timestamps sia presente prima di leggerla.
Le voci word sono { "word": "...", "start": 0.0, "end": 0.5 } e le voci segment sono { "text": "...", "start": 0.0, "end": 3.2 }, con tutti i tempi in secondi.
I prezzi sono fatturati per secondo di audio in input. Consulta l’API Audio Transcriptions per esempi di richiesta e dettagli sui parametri.