/audio/speech e salve a resposta binária de áudio.
Use este guia para geração padrão de voz. Se você quiser criar fala a partir de uma voz de referência personalizada, veja Clonagem de Voz.
Uso Básico
tts-kokoro usa MP3 como padrão.
Escolha um Modelo e uma Voz
As vozes são específicas por modelo. O valor devoice deve ser válido para o model que você escolher.
Use a página Modelos de Texto para Fala para navegar pelos modelos e vozes disponíveis. O seletor de vozes lista os IDs exatos de voz para passar na sua requisição.
Os IDs de voz diferenciam maiúsculas de minúsculas. Se você trocar de modelo TTS, atualize o valor de
voice ao mesmo tempo.Formato da Requisição
Formato de Saída
Você pode omitirresponse_format para usar o padrão do modelo. Antes de escolher uma extensão de arquivo ou substituir o formato, consulte a API de Modelos para obter os valores atuais de default_format e supported_formats do modelo:
Content-Type da resposta identifica o formato de áudio retornado. Solicitar um formato que o modelo selecionado não suporta retorna HTTP 400.
Dicas de Produção
- Faça cache do áudio gerado quando o texto de origem e a voz forem reutilizados.
- Normalize e revise o texto antes da síntese. A pontuação afeta o ritmo e a entonação.
- Salve a saída com a extensão de arquivo correta para o formato de resposta do modelo.