Skip to main content
Speech-to-Text transkribiert gesprochene Audioaufnahmen in geschriebenen Text. Sende eine Audiodatei an /audio/transcriptions, wähle ein Transkriptionsmodell und lege das gewünschte Antwortformat fest. Du arbeitest mit der Aufnahme eines Gesprächs? Meeting-Notizen mit Speech-to-Text führt von einer Audiodatei zu Entscheidungen und Action Items, die die Sekunde zitieren, in der sie vereinbart wurden – einschließlich der Frage, welche Modelle Segment-Timings zurückgeben und wie du mit einem Transkript umgehst, das nie verrät, wer gerade spricht.

Grundlegende Nutzung

Unterstützte Eingaben

Unterstützte Audioformate sind wav, wave, flac, m4a, aac, mp4, mp3, ogg, oga und webm. Eine Datei wird akzeptiert, wenn entweder ihr MIME-Typ oder ihre Dateiendung auf dieser Liste steht, und die hochgeladenen Bytes müssen zusätzlich einen Magic-Byte-Check bestehen – das bloße Umbenennen einer Datei auf eine unterstützte Endung reicht nicht aus. Aktuelle Modellunterstützung und Preise findest du auf der Seite Speech-to-Text-Modelle.

Antwortformate

Das sind die einzigen beiden Werte, die response_format akzeptiert. Es gibt keine Option srt, vtt oder verbose_json – eine solche Anfrage gibt einen 400 zurück. Um Untertitel zu erstellen, verwende timestamps: true mit response_format: json und rendere die Timing-Daten selbst.

Timestamps

Übergib timestamps=true, um Timing-Daten zusammen mit dem Transkript zu erhalten. Die Unterstützung ist modellspezifisch, und die Granularität unterscheidet sich:
Das Standardmodell, nvidia/parakeet-tdt-0.6b-v3, akzeptiert timestamps=true und ignoriert es dann – du erhältst eine Antwort, die nur text enthält, ohne Fehler und ohne Warnung. Wähle ein Modell aus der Tabelle oben, wenn du Timings brauchst, und prüfe, ob der Schlüssel timestamps vorhanden ist, bevor du ihn ausliest.
Segment-Level-Modelle geben stattdessen ein segment-Array zurück, in dem jeder Eintrag { "text": "...", "start": 0.0, "end": 3.2 } ist. Alle Zeiten sind in Sekunden.
Kein Venice-Transkriptionsmodell führt Sprecher-Diarisierung durch, daher gibt es in keiner Antwort ein speaker-Feld. Ein Transkript ist ein einzelner Textstrom – Sprecher können nur zugeordnet werden, wenn ein Name laut ausgesprochen wird.

Tipps für den Produktiveinsatz

  • Halte das Audio klar und vermeide nach Möglichkeit sich überlappende Sprecher.
  • Teile sehr lange Aufnahmen in kleinere Chunks auf, wenn dein Workflow geringere Latenz oder einfachere Wiederholungen benötigt.
  • Speichere den ursprünglichen Audiopfad, die Modell-ID und das Antwortformat mit jedem Transkript, um die Nachvollziehbarkeit zu gewährleisten.

Verwandte Ressourcen