Skip to main content
El texto a voz convierte texto escrito en audio hablado. Elige un modelo de TTS, selecciona una voz admitida por ese modelo, envía el texto a /audio/speech y guarda la respuesta binaria de audio. Usa esta guía para la generación de voz estándar. Si quieres crear voz a partir de una voz de referencia personalizada, consulta Clonación de voz.

Uso básico

El cuerpo de la respuesta correcta es audio binario en el formato predeterminado del modelo, no JSON. Actualmente tts-kokoro usa MP3 de forma predeterminada.

Elige un modelo y una voz

Las voces son específicas de cada modelo. El valor de voice debe ser válido para el model que elijas. Usa la página de Modelos de texto a voz para explorar los modelos y voces disponibles. El selector de voces muestra los IDs de voz exactos que debes pasar en tu solicitud.
Los IDs de voz distinguen entre mayúsculas y minúsculas. Si cambias de modelo TTS, actualiza el valor de voice al mismo tiempo.

Estructura de la solicitud

Formato de salida

Puedes omitir response_format para usar el valor predeterminado del modelo. Antes de elegir una extensión de archivo o anular el formato, consulta la API de Modelos para obtener los valores actuales de default_format y supported_formats del modelo:
El Content-Type de la respuesta identifica el formato de audio devuelto. Solicitar un formato que el modelo seleccionado no admite devuelve HTTP 400.

Consejos para producción

  • Almacena en caché el audio generado cuando el texto de origen y la voz se reutilicen.
  • Normaliza y revisa el texto antes de sintetizarlo. La puntuación afecta el ritmo y la entonación.
  • Guarda la salida con la extensión de archivo correcta según el formato de respuesta del modelo.

Recursos relacionados