Skip to main content
API 요청에서 id 값을 model 매개변수로 사용하세요. 현재 5개의 모델을 사용할 수 있습니다.

사용법

Speech-to-text 모델은 음성 오디오를 텍스트로 전사합니다. Audio Transcriptions API를 통해 액세스할 수 있습니다.

지원되는 오디오 형식

wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm 파일의 MIME 유형 또는 확장자 중 하나가 이 목록에 있으면 허용되며, 업로드된 바이트에 대한 매직 바이트 검사도 통과해야 합니다. 파일 이름을 지원되는 확장자로 바꾸는 것만으로는 충분하지 않습니다.

응답 형식

타임스탬프

전사 결과와 함께 타이밍 데이터를 받으려면 timestamps: true를 설정하세요. 응답에 timestamps 객체가 추가되며, 세분성은 모델에 따라 다릅니다:
nvidia/parakeet-tdt-0.6b-v3은 기본 모델이며, timestamps: true를 받아들이지만 타이밍을 반환하지 않습니다. 오류도 경고도 없이 — 응답에는 text만 포함됩니다. 타이밍이 필요하면 위 표에서 모델을 선택하고, 읽기 전에 timestamps 키가 존재하는지 확인하세요.
단어 항목은 { "word": "...", "start": 0.0, "end": 0.5 }, 세그먼트 항목은 { "text": "...", "start": 0.0, "end": 3.2 } 형태이며, 모든 시간은 초 단위입니다.
가격은 입력 오디오의 초당 청구됩니다. 요청 예제와 매개변수 세부 정보는 Audio Transcriptions API를 참조하세요.