Skip to main content
Il text-to-speech trasforma il testo scritto in audio parlato. Scegli un modello TTS, seleziona una voce supportata da quel modello, invia il testo a /audio/speech e salva la risposta audio binaria. Usa questa guida per la generazione vocale standard. Se vuoi creare audio a partire da una voce di riferimento personalizzata, consulta Voice Cloning.

Utilizzo di Base

Il corpo della risposta di successo è audio binario nel formato predefinito del modello, non JSON. Attualmente tts-kokoro usa MP3 come formato predefinito.

Scelta di Modello e Voce

Le voci sono specifiche per modello. Il valore di voice deve essere valido per il model che scegli. Usa la pagina Modelli Text-to-Speech per esplorare i modelli e le voci disponibili. Il selettore delle voci elenca gli ID esatti da passare nella richiesta.
Gli ID delle voci fanno distinzione tra maiuscole e minuscole. Se cambi modello TTS, aggiorna contemporaneamente il valore di voice.

Struttura della Richiesta

Formato di Output

Puoi omettere response_format per usare il formato predefinito del modello. Prima di scegliere un’estensione di file o sovrascrivere il formato, interroga l’API Models per conoscere i valori correnti di default_format e supported_formats del modello:
L’header Content-Type della risposta identifica il formato audio restituito. Richiedere un formato non supportato dal modello selezionato restituisce HTTP 400.

Consigli per la Produzione

  • Metti in cache l’audio generato quando il testo sorgente e la voce vengono riutilizzati.
  • Normalizza e revisiona il testo prima della sintesi. La punteggiatura influenza ritmo e intonazione.
  • Salva l’output con l’estensione di file corretta in base al formato di risposta del modello.

Risorse Correlate