Verwenden Sie den
id-Wert als model-Parameter in API-Anfragen. Derzeit sind 5 Modelle verfügbar.Verwendung
Speech-to-Text-Modelle transkribieren gesprochenes Audio in geschriebenen Text. Sie werden über die Audio-Transcriptions-API aufgerufen.Unterstützte Audioformate
wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm
Eine Datei wird akzeptiert, wenn entweder ihr MIME-Typ oder ihre Dateiendung auf dieser Liste steht, und sie muss zusätzlich einen Magic-Byte-Check der hochgeladenen Bytes bestehen. Das bloße Umbenennen einer Datei auf eine unterstützte Endung reicht nicht aus.
Antwortformate
Timestamps
Setzen Sietimestamps: true, um Timing-Daten zusammen mit dem Transkript zu erhalten. Die Antwort enthält dann ein timestamps-Objekt, dessen Granularität vom Modell abhängt:
Word-Einträge sind
{ "word": "...", "start": 0.0, "end": 0.5 } und Segment-Einträge sind { "text": "...", "start": 0.0, "end": 3.2 }, wobei alle Zeiten in Sekunden angegeben sind.
Die Abrechnung erfolgt pro Sekunde Eingabe-Audio. Anfrage-Beispiele und Parameterdetails finden Sie in der Audio-Transcriptions-API.