Skip to main content
语音转文本可将口语音频转录为文字。向 /audio/transcriptions 发送一个音频文件,选择转录模型,并指定所需的响应格式。 在处理对话录音?用语音转文本生成会议纪要从一个音频文件出发,得到能精确引用达成时刻(精确到秒)的决策和行动项,还包括哪些模型会返回分段时间戳,以及如何处理一份从不说明谁在发言的转录文本。

基本用法

支持的输入

支持的音频格式为 wavwaveflacm4aaacmp4mp3oggogawebm。当文件的 MIME 类型或扩展名在该列表中时即被接受,且上传的字节还必须通过 magic-byte 检查——将文件重命名为受支持的扩展名并不能使其通过。请查阅 语音转文本模型 页面了解当前模型支持情况和价格。

响应格式

response_format 仅接受这两个值。不存在 srtvttverbose_json 选项——请求这些值会返回 400。要制作字幕,请在 response_format: json 下使用 timestamps: true,并自行渲染时间数据。

时间戳

传入 timestamps=true 可在转录文本之外获取时间数据。支持情况因模型而异,粒度也不同:
默认模型 nvidia/parakeet-tdt-0.6b-v3 会接受 timestamps=true 然后忽略它——您得到的响应只包含 text,没有错误也没有警告。如果需要时间信息,请从上表中选择一个模型,并在读取之前检查 timestamps 键是否存在。
分段级模型则返回一个 segment 数组,其中每个条目为 { "text": "...", "start": 0.0, "end": 3.2 }。所有时间均以秒为单位。
Venice 的转录模型均不执行说话人分离(speaker diarization),因此任何响应中都没有 speaker 字段。转录是单一的文本流——只有当名字被明确说出时才能归属说话人。

生产环境建议

  • 尽量保证音频清晰,避免多人同时说话。
  • 如果工作流需要更低延迟或更方便重试,可将过长的录音切分为较小的片段。
  • 为每份转录保存原始音频路径、模型 ID 和响应格式,便于审计。

相关资源