API 요청에서
id 값을 model 매개변수로 사용하세요. 현재 5개의 모델을 사용할 수 있습니다.사용법
Speech-to-text 모델은 음성 오디오를 텍스트로 전사합니다. Audio Transcriptions API를 통해 액세스할 수 있습니다.지원되는 오디오 형식
wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm
파일의 MIME 유형 또는 확장자 중 하나가 이 목록에 있으면 허용되며, 업로드된 바이트에 대한 매직 바이트 검사도 통과해야 합니다. 파일 이름을 지원되는 확장자로 바꾸는 것만으로는 충분하지 않습니다.
응답 형식
타임스탬프
전사 결과와 함께 타이밍 데이터를 받으려면timestamps: true를 설정하세요. 응답에 timestamps 객체가 추가되며, 세분성은 모델에 따라 다릅니다:
단어 항목은
{ "word": "...", "start": 0.0, "end": 0.5 }, 세그먼트 항목은 { "text": "...", "start": 0.0, "end": 3.2 } 형태이며, 모든 시간은 초 단위입니다.
가격은 입력 오디오의 초당 청구됩니다. 요청 예제와 매개변수 세부 정보는 Audio Transcriptions API를 참조하세요.