> ## Documentation Index
> Fetch the complete documentation index at: https://docs.venice.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 文档处理

> 使用 Venice Text Parser API 从文档中提取文本和 token 数量，然后在提示、嵌入和数据管道中复用输出。

Text Parser API 可在不运行模型推理的情况下从文档中提取文本。当你的应用需要在将文档内容发送给模型之前进行检查、存储、索引或复用时，请使用此 API。

支持的输入包括 PDF、DOCX、PPTX、XLSX 以及最大 25 MB 的纯文本文件。

## 解析文档

以 `multipart/form-data` 形式上传文件：

```bash theme={"system"}
curl https://api.venice.ai/api/v1/augment/text-parser \
  -H "Authorization: Bearer $VENICE_API_KEY" \
  -F "file=@document.pdf" \
  -F "response_format=json"
```

默认的 `json` 响应格式会返回提取的文本及其 token 数量。当你只需要提取的文本时，请使用 `response_format=text`。

## Text Parser 还是 Chat 文件输入？

这两项功能都可以提取文档内容，但适用于不同的工作流：

| 需求                | 使用                                        |
| ----------------- | ----------------------------------------- |
| 立即让模型基于文档进行问答     | [Chat 文件输入](/guides/features/file-inputs) |
| 在不进行推理的情况下提取文本    | Text Parser                               |
| 在选择模型前检查 token 数量 | Text Parser                               |
| 存储、索引或复用提取的内容     | Text Parser                               |
| 在多个提示中使用同一份文档     | Text Parser                               |

## 典型流水线

<Steps>
  <Step title="解析文件">
    上传源文档并请求 JSON 响应。
  </Step>

  <Step title="检查输出">
    对照目标模型的上下文窗口检查 token 数量。在推理前修剪或拆分较大的文档。
  </Step>

  <Step title="使用文本">
    将其添加到聊天提示中、生成用于检索的嵌入，或保存到你自己的数据存储中。
  </Step>
</Steps>

<Info>
  解析在内存中进行，且零数据保留。Venice 处理上传的文档后会立即将其丢弃，不会存储或记录其内容。
</Info>

<Warning>
  Text Parser API 处于实验阶段。其请求和响应格式可能会在不另行通知的情况下发生变化。
</Warning>

## 相关资源

* [Text Parser API 参考](/api-reference/endpoint/augment/text-parser)
* [文件输入](/guides/features/file-inputs)
* [嵌入](/guides/features/embeddings)
* [文本模型](/models/text)
