Skip to main content
Text-to-Speech wandelt geschriebenen Text in gesprochenes Audio um. Wähle ein TTS-Modell, wähle eine von diesem Modell unterstützte Stimme, sende den Text an /audio/speech und speichere die binäre Audioantwort. Nutze diese Anleitung für die Standard-Sprachgenerierung. Wenn du Sprache aus einer benutzerdefinierten Referenzstimme erzeugen möchtest, siehe Voice Cloning.

Grundlegende Nutzung

Der Body einer erfolgreichen Antwort ist Binär-Audio im Standardformat des Modells und kein JSON. tts-kokoro verwendet derzeit standardmäßig MP3.

Modell und Stimme auswählen

Stimmen sind modellspezifisch. Der voice-Wert muss zu dem gewählten model passen. Auf der Seite Text-to-Speech-Modelle kannst du verfügbare Modelle und Stimmen durchsuchen. Der Voice-Picker listet die exakten Voice-IDs auf, die du in deiner Anfrage übergeben musst.
Voice-IDs unterscheiden zwischen Groß- und Kleinschreibung. Wenn du das TTS-Modell wechselst, aktualisiere gleichzeitig den voice-Wert.

Aufbau der Anfrage

Ausgabeformat

Du kannst response_format weglassen, um das Standardformat des Modells zu verwenden. Bevor du eine Dateiendung wählst oder das Format überschreibst, frage die Models-API nach dem aktuellen default_format und den supported_formats des Modells ab:
Der Content-Type der Antwort gibt das zurückgegebene Audioformat an. Wird ein Format angefordert, das das gewählte Modell nicht unterstützt, gibt die API HTTP 400 zurück.

Tipps für den Produktiveinsatz

  • Zwischenspeichere erzeugtes Audio, wenn derselbe Quelltext und dieselbe Stimme wiederverwendet werden.
  • Normalisiere und korrigiere den Text vor der Synthese. Interpunktion beeinflusst Tempo und Intonation.
  • Speichere die Ausgabe mit der korrekten Dateiendung für das Antwortformat des Modells.

Verwandte Ressourcen