/audio/speech und speichere die binäre Audioantwort.
Nutze diese Anleitung für die Standard-Sprachgenerierung. Wenn du Sprache aus einer benutzerdefinierten Referenzstimme erzeugen möchtest, siehe Voice Cloning.
Grundlegende Nutzung
tts-kokoro verwendet derzeit standardmäßig MP3.
Modell und Stimme auswählen
Stimmen sind modellspezifisch. Dervoice-Wert muss zu dem gewählten model passen.
Auf der Seite Text-to-Speech-Modelle kannst du verfügbare Modelle und Stimmen durchsuchen. Der Voice-Picker listet die exakten Voice-IDs auf, die du in deiner Anfrage übergeben musst.
Voice-IDs unterscheiden zwischen Groß- und Kleinschreibung. Wenn du das TTS-Modell wechselst, aktualisiere gleichzeitig den
voice-Wert.Aufbau der Anfrage
Ausgabeformat
Du kannstresponse_format weglassen, um das Standardformat des Modells zu verwenden. Bevor du eine Dateiendung wählst oder das Format überschreibst, frage die Models-API nach dem aktuellen default_format und den supported_formats des Modells ab:
Content-Type der Antwort gibt das zurückgegebene Audioformat an. Wird ein Format angefordert, das das gewählte Modell nicht unterstützt, gibt die API HTTP 400 zurück.
Tipps für den Produktiveinsatz
- Zwischenspeichere erzeugtes Audio, wenn derselbe Quelltext und dieselbe Stimme wiederverwendet werden.
- Normalisiere und korrigiere den Text vor der Synthese. Interpunktion beeinflusst Tempo und Intonation.
- Speichere die Ausgabe mit der korrekten Dateiendung für das Antwortformat des Modells.