Skip to main content
语音克隆让你可以使用一段简短的参考音频样本所提供的声音来生成语音。借助 tts-chatterbox-hd,你可以将样本上传至 /audio/voices,保存返回的 vv_... 语音句柄,然后将该句柄传给 /audio/speech
语音句柄与模型绑定。使用 tts-chatterbox-hd 创建的句柄必须与 tts-chatterbox-hd 一起使用。

工作原理

  1. 上传 —— 将干净的参考音频文件发送至 POST /audio/voices
  2. 保存 —— 存储返回的 id 语音句柄
  3. 生成 —— 在 POST /audio/speech 中将该句柄作为 voice 传入

前置条件

  • 一个 Venice API 密钥
  • 一段 MP3、WAV、FLAC 或 MP4 格式的干净参考样本
  • 至少 5 到 10 秒来自同一位讲话者的清晰语音
设置你的 API 密钥:

步骤 1:上传语音样本

通过将参考音频作为 multipart form data 上传来创建语音句柄:
使用 curl -F 时,请勿手动设置 Content-Typecurl 会自动添加 multipart/form-data 头以及所需的 boundary。 响应 (200):
保存 id 以用于语音生成:

步骤 2:生成语音

在语音请求中将克隆的语音句柄作为 voice 传入:
响应主体是模型默认格式的二进制音频,而非 JSON。tts-chatterbox-hd 目前默认为 WAV。

完整示例

此示例上传一段参考样本,使用 jq 提取语音句柄,并将生成的音频写入 chatterbox-clone.wav

语音样本建议

使用单人讲话、背景噪声最小且无音乐的样本。自然语音的效果优于耳语、歌唱或经过大量处理的音频。 当声音具有独特的节奏、口音或语调时,更长的样本可能会有帮助,但请确保样本始终聚焦于目标讲话者。

句柄过期

Chatterbox HD 克隆是零样本的:Venice 会临时存储上传的参考音频,模型在你合成语音时读取该音频。系统不会创建持久化的声音模板。 语音句柄会在 7 天后自动过期。句柄过期后,请再次上传参考样本以创建新的 vv_... 句柄。

发现克隆支持

支持克隆的模型会在模型规格中包含 voice_cloning 对象。查询 TTS 模型以检查支持的格式、最小样本时长和保留期:
tts-chatterbox-hd 声明:

API 参数

创建语音

生成语音

语音成功响应的主体是二进制音频,其 Content-Type 标识返回的格式。你可以省略 response_format 以使用模型默认值。在覆盖此值之前,请通过 GET /models?type=tts 查询 model_spec.supported_formatsmodel_spec.default_format;请求不受支持的格式会返回 HTTP 400

常见错误