/audio/transcriptions, choisissez un modèle de transcription et sélectionnez le format de réponse que vous souhaitez recevoir.
Vous travaillez sur l’enregistrement d’une conversation ? Notes de réunion avec la reconnaissance vocale part d’un fichier audio pour aboutir à des décisions et des actions à réaliser qui citent la seconde où elles ont été convenues, en précisant quels modèles renvoient les horodatages de segments et comment gérer une transcription qui ne dit jamais qui parle.
Utilisation de base
Entrées prises en charge
Les formats audio pris en charge sontwav, wave, flac, m4a, aac, mp4, mp3, ogg, oga et webm. Un fichier est accepté lorsque son type MIME ou son extension figure dans cette liste, et les octets téléversés doivent également passer une vérification des octets magiques — renommer un fichier avec une extension prise en charge ne suffira pas. Consultez la page Modèles de reconnaissance vocale pour connaître les modèles actuellement pris en charge et les tarifs.
Formats de réponse
Ce sont les deux seules valeurs acceptées par
response_format. Il n’existe pas d’option srt, vtt ou verbose_json — en demander une renvoie un 400. Pour créer des sous-titres, utilisez timestamps: true avec response_format: json et générez vous-même le rendu des données temporelles.Timestamps
Passeztimestamps=true pour recevoir des données temporelles avec la transcription. La prise en charge est spécifique au modèle, et la granularité diffère :
segment, où chaque entrée est { "text": "...", "start": 0.0, "end": 3.2 }. Tous les temps sont en secondes.
Aucun modèle de transcription Venice n’effectue de diarisation des locuteurs, il n’y a donc pas de champ
speaker dans les réponses. Une transcription est un flux de texte unique — les locuteurs ne peuvent être attribués que lorsqu’un nom est prononcé à voix haute.Conseils pour la production
- Gardez l’audio clair et évitez les locuteurs qui se chevauchent lorsque possible.
- Découpez les enregistrements très longs en fragments plus petits si votre flux de travail nécessite une latence plus faible ou des réessais plus faciles.
- Stockez le chemin audio d’origine, l’identifiant du modèle et le format de réponse avec chaque transcription pour la traçabilité.