Skip to main content
Verwenden Sie den id-Wert als model-Parameter in API-Anfragen. Derzeit sind 5 Modelle verfügbar.

Verwendung

Speech-to-Text-Modelle transkribieren gesprochenes Audio in geschriebenen Text. Sie werden über die Audio-Transcriptions-API aufgerufen.

Unterstützte Audioformate

wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga, webm Eine Datei wird akzeptiert, wenn entweder ihr MIME-Typ oder ihre Dateiendung auf dieser Liste steht, und sie muss zusätzlich einen Magic-Byte-Check der hochgeladenen Bytes bestehen. Das bloße Umbenennen einer Datei auf eine unterstützte Endung reicht nicht aus.

Antwortformate

Timestamps

Setzen Sie timestamps: true, um Timing-Daten zusammen mit dem Transkript zu erhalten. Die Antwort enthält dann ein timestamps-Objekt, dessen Granularität vom Modell abhängt:
nvidia/parakeet-tdt-0.6b-v3 ist das Standardmodell, und es akzeptiert timestamps: true, ohne Timings zurückzugeben. Es gibt keinen Fehler und keine Warnung – die Antwort enthält einfach nur text und sonst nichts. Wenn Sie Timings benötigen, wählen Sie ein Modell aus der Tabelle oben und prüfen Sie, ob der Schlüssel timestamps vorhanden ist, bevor Sie ihn auslesen.
Word-Einträge sind { "word": "...", "start": 0.0, "end": 0.5 } und Segment-Einträge sind { "text": "...", "start": 0.0, "end": 3.2 }, wobei alle Zeiten in Sekunden angegeben sind.
Die Abrechnung erfolgt pro Sekunde Eingabe-Audio. Anfrage-Beispiele und Parameterdetails finden Sie in der Audio-Transcriptions-API.