/audio/transcriptions, wähle ein Transkriptionsmodell und lege das gewünschte Antwortformat fest.
Du arbeitest mit der Aufnahme eines Gesprächs? Meeting-Notizen mit Speech-to-Text führt von einer Audiodatei zu Entscheidungen und Action Items, die die Sekunde zitieren, in der sie vereinbart wurden – einschließlich der Frage, welche Modelle Segment-Timings zurückgeben und wie du mit einem Transkript umgehst, das nie verrät, wer gerade spricht.
Grundlegende Nutzung
Unterstützte Eingaben
Unterstützte Audioformate sindwav, wave, flac, m4a, aac, mp4, mp3, ogg, oga und webm. Eine Datei wird akzeptiert, wenn entweder ihr MIME-Typ oder ihre Dateiendung auf dieser Liste steht, und die hochgeladenen Bytes müssen zusätzlich einen Magic-Byte-Check bestehen – das bloße Umbenennen einer Datei auf eine unterstützte Endung reicht nicht aus. Aktuelle Modellunterstützung und Preise findest du auf der Seite Speech-to-Text-Modelle.
Antwortformate
Das sind die einzigen beiden Werte, die
response_format akzeptiert. Es gibt keine Option srt, vtt oder verbose_json – eine solche Anfrage gibt einen 400 zurück. Um Untertitel zu erstellen, verwende timestamps: true mit response_format: json und rendere die Timing-Daten selbst.Timestamps
Übergibtimestamps=true, um Timing-Daten zusammen mit dem Transkript zu erhalten. Die Unterstützung ist modellspezifisch, und die Granularität unterscheidet sich:
segment-Array zurück, in dem jeder Eintrag { "text": "...", "start": 0.0, "end": 3.2 } ist. Alle Zeiten sind in Sekunden.
Kein Venice-Transkriptionsmodell führt Sprecher-Diarisierung durch, daher gibt es in keiner Antwort ein
speaker-Feld. Ein Transkript ist ein einzelner Textstrom – Sprecher können nur zugeordnet werden, wenn ein Name laut ausgesprochen wird.Tipps für den Produktiveinsatz
- Halte das Audio klar und vermeide nach Möglichkeit sich überlappende Sprecher.
- Teile sehr lange Aufnahmen in kleinere Chunks auf, wenn dein Workflow geringere Latenz oder einfachere Wiederholungen benötigt.
- Speichere den ursprünglichen Audiopfad, die Modell-ID und das Antwortformat mit jedem Transkript, um die Nachvollziehbarkeit zu gewährleisten.