跳转到主要内容
Text Parser API 可在不运行模型推理的情况下从文档中提取文本。当你的应用需要在将文档内容发送给模型之前进行检查、存储、索引或复用时,请使用此 API。 支持的输入包括 PDF、DOCX、PPTX、XLSX 以及最大 25 MB 的纯文本文件。

解析文档

multipart/form-data 形式上传文件:
默认的 json 响应格式会返回提取的文本及其 token 数量。当你只需要提取的文本时,请使用 response_format=text

Text Parser 还是 Chat 文件输入?

这两项功能都可以提取文档内容,但适用于不同的工作流:

典型流水线

1

解析文件

上传源文档并请求 JSON 响应。
2

检查输出

对照目标模型的上下文窗口检查 token 数量。在推理前修剪或拆分较大的文档。
3

使用文本

将其添加到聊天提示中、生成用于检索的嵌入,或保存到你自己的数据存储中。
解析在内存中进行,且零数据保留。Venice 处理上传的文档后会立即将其丢弃,不会存储或记录其内容。
Text Parser API 处于实验阶段。其请求和响应格式可能会在不另行通知的情况下发生变化。

相关资源