/audio/transcriptions 发送一个音频文件,选择转录模型,并指定所需的响应格式。
在处理对话录音?用语音转文本生成会议纪要从一个音频文件出发,得到能精确引用达成时刻(精确到秒)的决策和行动项,还包括哪些模型会返回分段时间戳,以及如何处理一份从不说明谁在发言的转录文本。
基本用法
支持的输入
支持的音频格式为wav、wave、flac、m4a、aac、mp4、mp3、ogg、oga 和 webm。当文件的 MIME 类型或扩展名在该列表中时即被接受,且上传的字节还必须通过 magic-byte 检查——将文件重命名为受支持的扩展名并不能使其通过。请查阅 语音转文本模型 页面了解当前模型支持情况和价格。
响应格式
response_format 仅接受这两个值。不存在 srt、vtt 或 verbose_json 选项——请求这些值会返回 400。要制作字幕,请在 response_format: json 下使用 timestamps: true,并自行渲染时间数据。时间戳
传入timestamps=true 可在转录文本之外获取时间数据。支持情况因模型而异,粒度也不同:
segment 数组,其中每个条目为 { "text": "...", "start": 0.0, "end": 3.2 }。所有时间均以秒为单位。
Venice 的转录模型均不执行说话人分离(speaker diarization),因此任何响应中都没有
speaker 字段。转录是单一的文本流——只有当名字被明确说出时才能归属说话人。生产环境建议
- 尽量保证音频清晰,避免多人同时说话。
- 如果工作流需要更低延迟或更方便重试,可将过长的录音切分为较小的片段。
- 为每份转录保存原始音频路径、模型 ID 和响应格式,便于审计。