在 API 请求中,将
id 值用作 model 参数。当前有 5 个模型可用。使用方式
语音转文本模型可将口语音频转录为书面文本。它们通过 Audio Transcriptions API 访问。支持的音频格式
wav、wave、flac、m4a、aac、mp4、mp3、ogg、oga、webm
当文件的 MIME 类型或扩展名在此列表中时即被接受,同时还必须通过对上传字节的 magic-byte 检查。仅将文件重命名为受支持的扩展名是不够的。
响应格式
时间戳
设置timestamps: true 可在转录文本之外接收时间数据。响应会新增一个 timestamps 对象,其粒度取决于模型:
词级条目为
{ "word": "...", "start": 0.0, "end": 0.5 },段级条目为 { "text": "...", "start": 0.0, "end": 3.2 },所有时间均以秒为单位。
计费按输入音频的秒数进行。请参阅 Audio Transcriptions API 了解请求示例和参数细节。