Skip to main content
在 API 请求中,将 id 值用作 model 参数。当前有 5 个模型可用。

使用方式

语音转文本模型可将口语音频转录为书面文本。它们通过 Audio Transcriptions API 访问。

支持的音频格式

wavwaveflacm4aaacmp4mp3oggogawebm 当文件的 MIME 类型或扩展名在此列表中时即被接受,同时还必须通过对上传字节的 magic-byte 检查。仅将文件重命名为受支持的扩展名是不够的。

响应格式

时间戳

设置 timestamps: true 可在转录文本之外接收时间数据。响应会新增一个 timestamps 对象,其粒度取决于模型:
nvidia/parakeet-tdt-0.6b-v3 是默认模型,它会接受 timestamps: true 但不返回时间信息。没有错误也没有警告——响应只包含 text,别无其他。如果需要时间信息,请从上表中选择一个模型,并在读取之前检查 timestamps 键是否存在。
词级条目为 { "word": "...", "start": 0.0, "end": 0.5 },段级条目为 { "text": "...", "start": 0.0, "end": 3.2 },所有时间均以秒为单位。
计费按输入音频的秒数进行。请参阅 Audio Transcriptions API 了解请求示例和参数细节。