> ## Documentation Index
> Fetch the complete documentation index at: https://docs.venice.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Dokumentenverarbeitung

> Extrahieren Sie Text und Token-Anzahl aus Dokumenten mit der Venice Text Parser API und verwenden Sie die Ausgabe in Prompts, Embeddings und Datenpipelines weiter.

Die Text Parser API extrahiert Text aus einem Dokument, ohne eine Modellinferenz auszuführen. Verwenden Sie sie, wenn Ihre Anwendung Dokumentinhalte prüfen, speichern, indizieren oder wiederverwenden muss, bevor sie an ein Modell gesendet werden.

Zu den unterstützten Eingaben zählen PDF-, DOCX-, PPTX-, XLSX- und einfache Textdateien mit bis zu 25 MB.

## Ein Dokument parsen

Laden Sie die Datei als `multipart/form-data` hoch:

```bash theme={"system"}
curl https://api.venice.ai/api/v1/augment/text-parser \
  -H "Authorization: Bearer $VENICE_API_KEY" \
  -F "file=@document.pdf" \
  -F "response_format=json"
```

Das Standard-Antwortformat `json` gibt den extrahierten Text und seine Token-Anzahl zurück. Verwenden Sie `response_format=text`, wenn Sie nur den extrahierten Text benötigen.

## Text Parser oder Chat File Input?

Beide Funktionen extrahieren Dokumentinhalte, dienen jedoch unterschiedlichen Workflows:

| Bedarf                                                         | Verwendung                                      |
| -------------------------------------------------------------- | ----------------------------------------------- |
| Ein Modell sofort zu einem Dokument befragen                   | [Chat File Input](/guides/features/file-inputs) |
| Text ohne Inferenz extrahieren                                 | Text Parser                                     |
| Token-Anzahl prüfen, bevor ein Modell gewählt wird             | Text Parser                                     |
| Extrahierte Inhalte speichern, indizieren oder wiederverwenden | Text Parser                                     |
| Dasselbe Dokument über mehrere Prompts hinweg verwenden        | Text Parser                                     |

## Typische Pipeline

<Steps>
  <Step title="Datei parsen">
    Laden Sie das Quelldokument hoch und fordern Sie eine JSON-Antwort an.
  </Step>

  <Step title="Ausgabe prüfen">
    Vergleichen Sie die Token-Anzahl mit dem Kontextfenster des Zielmodells. Kürzen oder teilen Sie große Dokumente vor der Inferenz.
  </Step>

  <Step title="Text verwenden">
    Fügen Sie ihn zu einem Chat-Prompt hinzu, erzeugen Sie Embeddings für Retrieval oder speichern Sie ihn in Ihrem eigenen Datenspeicher.
  </Step>
</Steps>

<Info>
  Das Parsen erfolgt im Arbeitsspeicher mit Zero Data Retention. Venice verarbeitet das hochgeladene Dokument und verwirft es sofort, ohne seinen Inhalt zu speichern oder zu protokollieren.
</Info>

<Warning>
  Die Text Parser API ist experimentell. Ihr Anfrage- und Antwortformat kann sich ohne Vorankündigung ändern.
</Warning>

## Weiterführende Ressourcen

* [Text Parser API-Referenz](/api-reference/endpoint/augment/text-parser)
* [File Inputs](/guides/features/file-inputs)
* [Embeddings](/guides/features/embeddings)
* [Textmodelle](/models/text)
