/audio/speech로 전송한 뒤 바이너리 오디오 응답을 저장하세요.
이 가이드는 표준 음성 생성을 다룹니다. 사용자 지정 참조 음성으로부터 음성을 생성하려면 음성 복제를 참조하세요.
기본 사용법
tts-kokoro는 현재 MP3를 기본값으로 사용합니다.
모델과 음성 선택
음성은 모델별로 다릅니다.voice 값은 선택한 model에 유효해야 합니다.
사용 가능한 모델과 음성을 살펴보려면 텍스트-음성 변환 모델 페이지를 이용하세요. 음성 선택기는 요청에 전달할 정확한 음성 ID를 표시합니다.
음성 ID는 대소문자를 구분합니다. TTS 모델을 변경할 때는
voice 값도 함께 업데이트하세요.요청 구조
출력 형식
response_format을 생략하면 모델의 기본 형식이 사용됩니다. 파일 확장자를 선택하거나 형식을 재정의하기 전에 Models API에서 모델의 현재 default_format과 supported_formats를 조회하세요:
Content-Type은 반환된 오디오 형식을 나타냅니다. 선택한 모델이 지원하지 않는 형식을 요청하면 HTTP 400이 반환됩니다.
프로덕션 팁
- 소스 텍스트와 음성이 재사용될 때는 생성된 오디오를 캐시하세요.
- 합성 전에 텍스트를 정규화하고 교정하세요. 구두점은 속도와 억양에 영향을 줍니다.
- 출력물은 모델의 응답 형식에 맞는 파일 확장자로 저장하세요.