tts-chatterbox-hd, téléversez un échantillon vers /audio/voices, enregistrez le handle de voix vv_... retourné, puis transmettez ce handle à /audio/speech.
Les handles de voix sont spécifiques à chaque modèle. Un handle créé avec
tts-chatterbox-hd doit être utilisé avec tts-chatterbox-hd.Fonctionnement
- Téléversement — Envoyez un fichier audio de référence propre à
POST /audio/voices - Enregistrement — Stockez le handle de voix
idretourné - Génération — Envoyez le handle comme
voicedansPOST /audio/speech
Prérequis
- Une clé API Venice
- Un échantillon de référence propre au format MP3, WAV, FLAC ou MP4
- Au moins 5 à 10 secondes de parole claire d’un seul locuteur
Étape 1 : téléverser un échantillon vocal
Créez un handle de voix en téléversant l’audio de référence sous forme de données de formulaire multipart :curl -F, ne définissez pas manuellement Content-Type. curl ajoute l’en-tête multipart/form-data et la limite requise.
Réponse (200) :
id pour la génération de parole :
Étape 2 : générer la parole
Transmettez le handle de voix cloné commevoice dans la requête de synthèse :
tts-chatterbox-hd produit actuellement du WAV par défaut.
Exemple complet
Cet exemple téléverse un échantillon de référence, extrait le handle de voix avecjq et écrit l’audio généré dans chatterbox-clone.wav :
Conseils pour l’échantillon vocal
Utilisez un échantillon avec un seul locuteur, un bruit de fond minimal et sans musique. La parole naturelle fonctionne mieux que l’audio chuchoté, chanté ou fortement traité. Des échantillons plus longs peuvent être utiles lorsque la voix a un rythme, un accent ou un ton distinctifs, mais gardez l’échantillon centré sur le locuteur cible.Expiration des handles
Le clonage Chatterbox HD est zero-shot : Venice stocke temporairement l’audio de référence téléversé, et le modèle le lit lorsque vous synthétisez de la parole. Aucun modèle vocal persistant n’est créé. Les handles de voix expirent automatiquement après 7 jours. Une fois qu’un handle a expiré, téléversez à nouveau l’échantillon de référence pour créer un nouveau handlevv_....
Découvrir la prise en charge du clonage
Les modèles qui prennent en charge le clonage incluent un objetvoice_cloning dans la spécification du modèle. Interrogez les modèles TTS pour vérifier les formats pris en charge, la durée minimale de l’échantillon et la rétention :
tts-chatterbox-hd annonce :
Paramètres de l’API
Créer une voix
Générer la parole
La réponse de synthèse en cas de succès est de l’audio binaire, et son
Content-Type identifie le format retourné. Vous pouvez omettre response_format pour utiliser la valeur par défaut du modèle. Interrogez model_spec.supported_formats et model_spec.default_format via GET /models?type=tts avant de la remplacer ; demander un format non pris en charge renvoie un HTTP 400.