tts-chatterbox-hd,你可以将样本上传至 /audio/voices,保存返回的 vv_... 语音句柄,然后将该句柄传给 /audio/speech。
语音句柄与模型绑定。使用
tts-chatterbox-hd 创建的句柄必须与 tts-chatterbox-hd 一起使用。工作原理
- 上传 —— 将干净的参考音频文件发送至
POST /audio/voices - 保存 —— 存储返回的
id语音句柄 - 生成 —— 在
POST /audio/speech中将该句柄作为voice传入
前置条件
- 一个 Venice API 密钥
- 一段 MP3、WAV、FLAC 或 MP4 格式的干净参考样本
- 至少 5 到 10 秒来自同一位讲话者的清晰语音
步骤 1:上传语音样本
通过将参考音频作为 multipart form data 上传来创建语音句柄:curl -F 时,请勿手动设置 Content-Type。curl 会自动添加 multipart/form-data 头以及所需的 boundary。
响应 (200):
id 以用于语音生成:
步骤 2:生成语音
在语音请求中将克隆的语音句柄作为voice 传入:
tts-chatterbox-hd 目前默认为 WAV。
完整示例
此示例上传一段参考样本,使用jq 提取语音句柄,并将生成的音频写入 chatterbox-clone.wav:
语音样本建议
使用单人讲话、背景噪声最小且无音乐的样本。自然语音的效果优于耳语、歌唱或经过大量处理的音频。 当声音具有独特的节奏、口音或语调时,更长的样本可能会有帮助,但请确保样本始终聚焦于目标讲话者。句柄过期
Chatterbox HD 克隆是零样本的:Venice 会临时存储上传的参考音频,模型在你合成语音时读取该音频。系统不会创建持久化的声音模板。 语音句柄会在 7 天后自动过期。句柄过期后,请再次上传参考样本以创建新的vv_... 句柄。
发现克隆支持
支持克隆的模型会在模型规格中包含voice_cloning 对象。查询 TTS 模型以检查支持的格式、最小样本时长和保留期:
tts-chatterbox-hd 声明:
API 参数
创建语音
生成语音
语音成功响应的主体是二进制音频,其
Content-Type 标识返回的格式。你可以省略 response_format 以使用模型默认值。在覆盖此值之前,请通过 GET /models?type=tts 查询 model_spec.supported_formats 和 model_spec.default_format;请求不受支持的格式会返回 HTTP 400。