Skip to main content
文本转语音可将书面文本合成为语音音频。选择一个 TTS 模型,选择该模型支持的音色,将文本发送到 /audio/speech,然后保存二进制的音频响应。 本指南适用于标准的语音生成。如果你希望使用自定义参考音色来生成语音,请参阅 语音克隆

基本用法

成功响应的主体是模型默认格式的二进制音频,而非 JSON。tts-kokoro 目前默认为 MP3。

选择模型和音色

音色是模型专属的。voice 的值必须对所选的 model 有效。 请在 文本转语音模型 页面浏览可用的模型和音色。音色选择器中列出了在请求中需要传入的确切音色 ID。
音色 ID 区分大小写。切换 TTS 模型时,请同时更新 voice 的值。

请求结构

输出格式

你可以省略 response_format 以使用模型的默认格式。在选择文件扩展名或覆盖格式之前,请通过 Models API 查询该模型当前的 default_formatsupported_formats
响应的 Content-Type 标识返回的音频格式。请求所选模型不支持的格式会返回 HTTP 400

生产环境建议

  • 当源文本和音色会被重复使用时,缓存生成的音频。
  • 合成前对文本进行规范化和校对。标点符号会影响节奏和语调。
  • 存储输出时请使用与模型响应格式相符的文件扩展名。

相关资源