tts-chatterbox-hd, envie uma amostra para /audio/voices, salve o handle de voz vv_... retornado e, em seguida, passe esse handle para /audio/speech.
Os handles de voz são específicos do modelo. Um handle criado com
tts-chatterbox-hd deve ser usado com tts-chatterbox-hd.Como funciona
- Envie - Envie um arquivo de áudio de referência limpo para
POST /audio/voices - Salve - Armazene o handle de voz
idretornado - Gere - Envie o handle como
voiceemPOST /audio/speech
Pré-requisitos
- Uma chave de API da Venice
- Uma amostra de referência limpa nos formatos MP3, WAV, FLAC ou MP4
- Pelo menos 5 a 10 segundos de fala clara de um único locutor
Etapa 1: enviar uma amostra de voz
Crie um handle de voz enviando o áudio de referência como multipart form data:curl -F, não defina Content-Type manualmente. O curl adiciona o cabeçalho multipart/form-data e o boundary necessário.
Resposta (200):
id para a geração de fala:
Etapa 2: gerar fala
Passe o handle de voz clonada comovoice na requisição de fala:
tts-chatterbox-hd usa WAV como padrão.
Exemplo completo
Este exemplo envia uma amostra de referência, extrai o handle de voz comjq e grava o áudio gerado em chatterbox-clone.wav:
Dicas para a amostra de voz
Use uma amostra com um único locutor, ruído de fundo mínimo e sem música. A fala natural funciona melhor do que áudio sussurrado, cantado ou muito processado. Amostras mais longas podem ajudar quando a voz tem ritmo, sotaque ou tom distintos, mas mantenha a amostra focada no locutor-alvo.Expiração do handle
A clonagem no Chatterbox HD é zero-shot: a Venice armazena o áudio de referência enviado temporariamente, e o modelo o lê quando você sintetiza fala. Nenhum template de voz persistente é criado. Os handles de voz expiram automaticamente após 7 dias. Depois que um handle expira, envie a amostra de referência novamente para criar um novo handlevv_....
Descobrir suporte a clonagem
Modelos que suportam clonagem incluem um objetovoice_cloning na especificação do modelo. Consulte os modelos de TTS para verificar os formatos suportados, o tamanho mínimo da amostra e a retenção:
tts-chatterbox-hd informa:
Parâmetros da API
Criar voz
Gerar fala
A resposta de fala bem-sucedida é áudio binário, e seu
Content-Type identifica o formato retornado. Você pode omitir response_format para usar o padrão do modelo. Consulte model_spec.supported_formats e model_spec.default_format em GET /models?type=tts antes de substituí-lo; solicitar um formato não suportado retorna HTTP 400.