Passer au contenu principal
La synthèse vocale transforme du texte écrit en audio parlé. Choisissez un modèle TTS, sélectionnez une voix prise en charge par ce modèle, envoyez le texte à /audio/speech et enregistrez la réponse audio binaire. Utilisez ce guide pour la génération de voix standard. Si vous souhaitez créer de la parole à partir d’une voix de référence personnalisée, consultez Clonage de voix.

Utilisation de base

Choisir un modèle et une voix

Les voix sont spécifiques au modèle. La valeur voice doit être valide pour le model choisi. Consultez la page Modèles de synthèse vocale pour parcourir les modèles et les voix disponibles. Le sélecteur de voix indique les identifiants exacts à transmettre dans votre requête.
Les identifiants de voix sont sensibles à la casse. Si vous changez de modèle TTS, mettez à jour la valeur voice en même temps.

Forme de la requête

Conseils pour la production

  • Mettez en cache l’audio généré lorsque le texte source et la voix sont réutilisés.
  • Normalisez et relisez le texte avant la synthèse. La ponctuation influence le rythme et l’intonation.
  • Stockez la sortie avec l’extension de fichier appropriée au format de réponse du modèle.

Ressources connexes