/audio/speech et enregistrez la réponse audio binaire.
Utilisez ce guide pour la génération de voix standard. Si vous souhaitez créer de la parole à partir d’une voix de référence personnalisée, consultez Clonage vocal.
Utilisation de base
tts-kokoro produit actuellement du MP3 par défaut.
Choisir un modèle et une voix
Les voix sont spécifiques au modèle. La valeurvoice doit être valide pour le model que vous choisissez.
Consultez la page Modèles de synthèse vocale pour parcourir les modèles et les voix disponibles. Le sélecteur de voix indique les identifiants exacts à transmettre dans votre requête.
Les identifiants de voix sont sensibles à la casse. Si vous changez de modèle TTS, mettez à jour la valeur
voice en même temps.Forme de la requête
Format de sortie
Vous pouvez omettreresponse_format pour utiliser la valeur par défaut du modèle. Avant de choisir une extension de fichier ou de remplacer le format, interrogez l’API Models pour obtenir les valeurs actuelles default_format et supported_formats du modèle :
Content-Type de la réponse identifie le format audio retourné. Demander un format que le modèle sélectionné ne prend pas en charge renvoie un HTTP 400.
Conseils pour la production
- Mettez en cache l’audio généré lorsque le texte source et la voix sont réutilisés.
- Normalisez et relisez le texte avant la synthèse. La ponctuation influence le rythme et l’intonation.
- Stockez la sortie avec l’extension de fichier appropriée au format de réponse du modèle.