tts-chatterbox-hd, carica un campione su /audio/voices, salva l’handle vocale vv_... restituito e poi passa quell’handle a /audio/speech.
Gli handle vocali sono specifici per modello. Un handle creato con
tts-chatterbox-hd deve essere usato con tts-chatterbox-hd.Come funziona
- Carica - Invia un file audio di riferimento pulito a
POST /audio/voices - Salva - Conserva l’handle vocale
idrestituito - Genera - Invia l’handle come
voiceinPOST /audio/speech
Prerequisiti
- Una chiave API Venice
- Un campione di riferimento pulito in formato MP3, WAV, FLAC o MP4
- Almeno 5-10 secondi di parlato chiaro da un singolo parlante
Passo 1: Carica un campione vocale
Crea un handle vocale caricando l’audio di riferimento come multipart form data:curl -F, non impostare manualmente Content-Type. curl aggiunge automaticamente l’header multipart/form-data e il boundary richiesto.
Risposta (200):
id per la generazione dell’audio:
Passo 2: Genera l’audio
Passa l’handle della voce clonata comevoice nella richiesta di sintesi:
tts-chatterbox-hd usa WAV come formato predefinito.
Esempio completo
Questo esempio carica un campione di riferimento, estrae l’handle vocale conjq e scrive l’audio generato in chatterbox-clone.wav:
Consigli per il campione vocale
Usa un campione con un solo parlante, rumore di fondo minimo e senza musica. Il parlato naturale funziona meglio dell’audio sussurrato, cantato o elaborato pesantemente. Campioni più lunghi possono aiutare quando la voce ha ritmo, accento o tono distintivi, ma mantieni il campione focalizzato sul parlante di riferimento.Scadenza dell’handle
Il cloning di Chatterbox HD è zero-shot: Venice conserva temporaneamente l’audio di riferimento caricato e il modello lo legge quando sintetizzi l’audio. Non viene creato alcun modello vocale persistente. Gli handle vocali scadono automaticamente dopo 7 giorni. Quando un handle scade, carica di nuovo il campione di riferimento per creare un nuovo handlevv_....
Scoprire il supporto al cloning
I modelli che supportano il cloning includono un oggettovoice_cloning nella specifica del modello. Interroga i modelli TTS per verificare i formati supportati, la lunghezza minima del campione e la ritenzione:
tts-chatterbox-hd espone:
Parametri API
Creazione voce
Generazione audio
La risposta di sintesi di successo è audio binario e il suo
Content-Type identifica il formato restituito. Puoi omettere response_format per usare il formato predefinito del modello. Interroga model_spec.supported_formats e model_spec.default_format tramite GET /models?type=tts prima di sovrascriverlo; richiedere un formato non supportato restituisce HTTP 400.