tts-chatterbox-hd lädst du ein Sample an /audio/voices hoch, speicherst das zurückgegebene vv_...-Voice-Handle und übergibst dieses Handle dann an /audio/speech.
Voice-Handles sind modellspezifisch. Ein mit
tts-chatterbox-hd erstelltes Handle muss mit tts-chatterbox-hd verwendet werden.Wie es funktioniert
- Upload – Sende eine saubere Referenz-Audiodatei an
POST /audio/voices - Speichern – Speichere das zurückgegebene
id-Voice-Handle - Generieren – Sende das Handle als
voiceanPOST /audio/speech
Voraussetzungen
- Ein Venice-API-Schlüssel
- Ein sauberes Referenz-Sample im Format MP3, WAV, FLAC oder MP4
- Mindestens 5 bis 10 Sekunden klar verständliche Sprache von einer einzigen Person
Schritt 1: Ein Stimmensample hochladen
Erstelle ein Voice-Handle, indem du die Referenz-Audiodatei als Multipart-Form-Data hochlädst:curl -F verwendest, setze den Content-Type nicht manuell. curl fügt den multipart/form-data-Header und den erforderlichen Boundary-Wert automatisch hinzu.
Antwort (200):
id für die Sprachgenerierung:
Schritt 2: Sprache generieren
Übergib das geklonte Voice-Handle alsvoice im Speech-Request:
tts-chatterbox-hd verwendet derzeit standardmäßig WAV.
Vollständiges Beispiel
Dieses Beispiel lädt ein Referenz-Sample hoch, extrahiert das Voice-Handle mitjq und schreibt das generierte Audio in chatterbox-clone.wav:
Tipps für Stimmensamples
Verwende ein Sample mit einer einzigen Sprecherin oder einem einzigen Sprecher, minimalen Hintergrundgeräuschen und ohne Musik. Natürliche Sprache funktioniert besser als geflüsterte, gesungene oder stark bearbeitete Audioaufnahmen. Längere Samples können helfen, wenn die Stimme ein markantes Sprechtempo, einen Akzent oder einen besonderen Tonfall hat – halte das Sample aber auf die Zielperson fokussiert.Ablauf von Handles
Chatterbox-HD-Cloning ist Zero-Shot: Venice speichert das hochgeladene Referenz-Audio nur temporär, und das Modell liest es ein, wenn du Sprache synthetisierst. Es wird kein dauerhaftes Voice-Template erstellt. Voice-Handles laufen automatisch nach 7 Tagen ab. Nach Ablauf eines Handles lädst du das Referenz-Sample erneut hoch, um ein neuesvv_...-Handle zu erzeugen.
Cloning-Support erkennen
Modelle, die Cloning unterstützen, enthalten einvoice_cloning-Objekt in der Model-Spec. Frage die TTS-Modelle ab, um unterstützte Formate, Mindest-Sample-Länge und Aufbewahrung zu prüfen:
tts-chatterbox-hd weist Folgendes aus:
API-Parameter
Voice erstellen
Sprache generieren
Die erfolgreiche Speech-Antwort ist Binär-Audio, und ihr
Content-Type gibt das zurückgegebene Format an. Du kannst response_format weglassen, um das Modell-Standardformat zu verwenden. Frage model_spec.supported_formats und model_spec.default_format über GET /models?type=tts ab, bevor du das Format überschreibst; die Anforderung eines nicht unterstützten Formats gibt HTTP 400 zurück.