/audio/speech y guarda la respuesta binaria de audio.
Usa esta guía para la generación de voz estándar. Si quieres crear voz a partir de una voz de referencia personalizada, consulta Clonación de voz.
Uso básico
tts-kokoro usa MP3 de forma predeterminada.
Elige un modelo y una voz
Las voces son específicas de cada modelo. El valor devoice debe ser válido para el model que elijas.
Usa la página de Modelos de texto a voz para explorar los modelos y voces disponibles. El selector de voces muestra los IDs de voz exactos que debes pasar en tu solicitud.
Los IDs de voz distinguen entre mayúsculas y minúsculas. Si cambias de modelo TTS, actualiza el valor de
voice al mismo tiempo.Estructura de la solicitud
Formato de salida
Puedes omitirresponse_format para usar el valor predeterminado del modelo. Antes de elegir una extensión de archivo o anular el formato, consulta la API de Modelos para obtener los valores actuales de default_format y supported_formats del modelo:
Content-Type de la respuesta identifica el formato de audio devuelto. Solicitar un formato que el modelo seleccionado no admite devuelve HTTP 400.
Consejos para producción
- Almacena en caché el audio generado cuando el texto de origen y la voz se reutilicen.
- Normaliza y revisa el texto antes de sintetizarlo. La puntuación afecta el ritmo y la entonación.
- Guarda la salida con la extensión de archivo correcta según el formato de respuesta del modelo.