Skip to main content
Utilisez la valeur id comme paramètre model dans les requêtes API. 5 modèles actuellement disponibles.

Utilisation

Les modèles de transcription convertissent l’audio parlé en texte écrit. Ils sont accessibles via l’API Audio Transcriptions.

Formats audio pris en charge

wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm Un fichier est accepté lorsque son type MIME ou son extension figure dans cette liste, et il doit également passer une vérification des octets magiques sur les octets téléversés. Renommer un fichier avec une extension prise en charge ne suffit pas.

Formats de réponse

Timestamps

Définissez timestamps: true pour recevoir des données temporelles avec la transcription. La réponse ajoute un objet timestamps dont la granularité dépend du modèle :
nvidia/parakeet-tdt-0.6b-v3 est le modèle par défaut, et il accepte timestamps: true sans renvoyer de données temporelles. Il n’y a ni erreur ni avertissement — la réponse contient simplement text et rien d’autre. Si vous avez besoin de données temporelles, choisissez un modèle du tableau ci-dessus et vérifiez que la clé timestamps est présente avant de la lire.
Les entrées au niveau du mot sont { "word": "...", "start": 0.0, "end": 0.5 } et les entrées au niveau du segment sont { "text": "...", "start": 0.0, "end": 3.2 }, tous les temps étant en secondes.
La tarification est facturée par seconde d’audio en entrée. Voir l’API Audio Transcriptions pour des exemples de requête et des détails sur les paramètres.