/audio/speech,然后保存二进制的音频响应。
本指南适用于标准的语音生成。如果你希望使用自定义参考音色来生成语音,请参阅 语音克隆。
基本用法
tts-kokoro 目前默认为 MP3。
选择模型和音色
音色是模型专属的。voice 的值必须对所选的 model 有效。
请在 文本转语音模型 页面浏览可用的模型和音色。音色选择器中列出了在请求中需要传入的确切音色 ID。
音色 ID 区分大小写。切换 TTS 模型时,请同时更新
voice 的值。请求结构
输出格式
你可以省略response_format 以使用模型的默认格式。在选择文件扩展名或覆盖格式之前,请通过 Models API 查询该模型当前的 default_format 和 supported_formats:
Content-Type 标识返回的音频格式。请求所选模型不支持的格式会返回 HTTP 400。
生产环境建议
- 当源文本和音色会被重复使用时,缓存生成的音频。
- 合成前对文本进行规范化和校对。标点符号会影响节奏和语调。
- 存储输出时请使用与模型响应格式相符的文件扩展名。