Skip to main content
Lo speech-to-text trascrive l’audio parlato in testo scritto. Invia un file audio a /audio/transcriptions, scegli un modello di trascrizione e seleziona il formato di risposta desiderato. Stai lavorando con la registrazione di una conversazione? Note di riunione con lo speech-to-text parte da un file audio e arriva a decisioni e azioni da fare che citano il secondo in cui sono state concordate, spiegando anche quali modelli restituiscono i timing dei segmenti e come gestire una trascrizione che non dice mai chi sta parlando.

Utilizzo di Base

Input Supportati

I formati audio supportati sono wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga e webm. Un file è accettato quando il suo MIME type o la sua estensione è in quella lista, e i byte caricati devono anche superare un controllo dei magic byte — rinominare un file con un’estensione supportata non lo farà passare. Consulta la pagina Modelli Speech-to-Text per il supporto dei modelli e i prezzi aggiornati.

Formati di Risposta

Questi sono gli unici due valori accettati da response_format. Non esistono le opzioni srt, vtt o verbose_json — richiederne una restituisce un 400. Per costruire sottotitoli, usa timestamps: true con response_format: json e renderizza tu stesso i dati di timing.

Timestamps

Passa timestamps=true per ricevere i dati di timing insieme alla trascrizione. Il supporto è specifico per modello e la granularità varia:
Il modello predefinito, nvidia/parakeet-tdt-0.6b-v3, accetta timestamps=true e poi lo ignora — ottieni una risposta contenente solo text, senza errori né avvisi. Scegli un modello dalla tabella qui sopra se hai bisogno dei timing e verifica che la chiave timestamps esista prima di leggerla.
I modelli a livello di segmento restituiscono invece un array segment, in cui ogni voce è { "text": "...", "start": 0.0, "end": 3.2 }. Tutti i tempi sono in secondi.
Nessun modello di trascrizione di Venice esegue la diarizzazione dei parlanti, quindi non esiste un campo speaker in alcuna risposta. Una trascrizione è un unico flusso di testo — i parlanti possono essere attribuiti solo quando un nome viene pronunciato ad alta voce.

Consigli per la Produzione

  • Mantieni l’audio chiaro ed evita, se possibile, la sovrapposizione tra parlanti.
  • Suddividi registrazioni molto lunghe in chunk più piccoli se il tuo flusso richiede minore latenza o retry più semplici.
  • Memorizza il percorso audio originale, l’ID del modello e il formato di risposta insieme a ogni trascrizione per esigenze di tracciabilità.

Risorse Correlate