Skip to main content
La synthèse vocale transforme du texte écrit en audio parlé. Choisissez un modèle TTS, sélectionnez une voix prise en charge par ce modèle, envoyez le texte à /audio/speech et enregistrez la réponse audio binaire. Utilisez ce guide pour la génération de voix standard. Si vous souhaitez créer de la parole à partir d’une voix de référence personnalisée, consultez Clonage vocal.

Utilisation de base

Le corps de la réponse en cas de succès est de l’audio binaire dans le format par défaut du modèle, et non du JSON. tts-kokoro produit actuellement du MP3 par défaut.

Choisir un modèle et une voix

Les voix sont spécifiques au modèle. La valeur voice doit être valide pour le model que vous choisissez. Consultez la page Modèles de synthèse vocale pour parcourir les modèles et les voix disponibles. Le sélecteur de voix indique les identifiants exacts à transmettre dans votre requête.
Les identifiants de voix sont sensibles à la casse. Si vous changez de modèle TTS, mettez à jour la valeur voice en même temps.

Forme de la requête

Format de sortie

Vous pouvez omettre response_format pour utiliser la valeur par défaut du modèle. Avant de choisir une extension de fichier ou de remplacer le format, interrogez l’API Models pour obtenir les valeurs actuelles default_format et supported_formats du modèle :
L’en-tête Content-Type de la réponse identifie le format audio retourné. Demander un format que le modèle sélectionné ne prend pas en charge renvoie un HTTP 400.

Conseils pour la production

  • Mettez en cache l’audio généré lorsque le texte source et la voix sont réutilisés.
  • Normalisez et relisez le texte avant la synthèse. La ponctuation influence le rythme et l’intonation.
  • Stockez la sortie avec l’extension de fichier appropriée au format de réponse du modèle.

Ressources connexes