Skip to main content
Il voice cloning ti permette di generare audio in una voce fornita da un breve campione audio di riferimento. Con tts-chatterbox-hd, carica un campione su /audio/voices, salva l’handle vocale vv_... restituito e poi passa quell’handle a /audio/speech.
Gli handle vocali sono specifici per modello. Un handle creato con tts-chatterbox-hd deve essere usato con tts-chatterbox-hd.

Come funziona

  1. Carica - Invia un file audio di riferimento pulito a POST /audio/voices
  2. Salva - Conserva l’handle vocale id restituito
  3. Genera - Invia l’handle come voice in POST /audio/speech

Prerequisiti

  • Una chiave API Venice
  • Un campione di riferimento pulito in formato MP3, WAV, FLAC o MP4
  • Almeno 5-10 secondi di parlato chiaro da un singolo parlante
Imposta la tua chiave API:

Passo 1: Carica un campione vocale

Crea un handle vocale caricando l’audio di riferimento come multipart form data:
Quando usi curl -F, non impostare manualmente Content-Type. curl aggiunge automaticamente l’header multipart/form-data e il boundary richiesto. Risposta (200):
Salva l’id per la generazione dell’audio:

Passo 2: Genera l’audio

Passa l’handle della voce clonata come voice nella richiesta di sintesi:
Il corpo della risposta è audio binario nel formato predefinito del modello, non JSON. Attualmente tts-chatterbox-hd usa WAV come formato predefinito.

Esempio completo

Questo esempio carica un campione di riferimento, estrae l’handle vocale con jq e scrive l’audio generato in chatterbox-clone.wav:

Consigli per il campione vocale

Usa un campione con un solo parlante, rumore di fondo minimo e senza musica. Il parlato naturale funziona meglio dell’audio sussurrato, cantato o elaborato pesantemente. Campioni più lunghi possono aiutare quando la voce ha ritmo, accento o tono distintivi, ma mantieni il campione focalizzato sul parlante di riferimento.

Scadenza dell’handle

Il cloning di Chatterbox HD è zero-shot: Venice conserva temporaneamente l’audio di riferimento caricato e il modello lo legge quando sintetizzi l’audio. Non viene creato alcun modello vocale persistente. Gli handle vocali scadono automaticamente dopo 7 giorni. Quando un handle scade, carica di nuovo il campione di riferimento per creare un nuovo handle vv_....

Scoprire il supporto al cloning

I modelli che supportano il cloning includono un oggetto voice_cloning nella specifica del modello. Interroga i modelli TTS per verificare i formati supportati, la lunghezza minima del campione e la ritenzione:
tts-chatterbox-hd espone:

Parametri API

Creazione voce

Generazione audio

La risposta di sintesi di successo è audio binario e il suo Content-Type identifica il formato restituito. Puoi omettere response_format per usare il formato predefinito del modello. Interroga model_spec.supported_formats e model_spec.default_format tramite GET /models?type=tts prima di sovrascriverlo; richiedere un formato non supportato restituisce HTTP 400.

Errori comuni