> ## Documentation Index
> Fetch the complete documentation index at: https://docs.venice.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# 문서 처리

> Venice Text Parser API로 문서에서 텍스트와 토큰 수를 추출한 뒤, 프롬프트, 임베딩, 데이터 파이프라인에서 재사용하세요.

Text Parser API는 모델 추론을 실행하지 않고 문서에서 텍스트를 추출합니다. 모델로 전송하기 전에 애플리케이션에서 문서 내용을 검사, 저장, 색인, 또는 재사용해야 할 때 사용하세요.

지원되는 입력에는 PDF, DOCX, PPTX, XLSX 및 최대 25 MB의 일반 텍스트 파일이 포함됩니다.

## 문서 파싱

파일을 `multipart/form-data`로 업로드하세요:

```bash theme={"system"}
curl https://api.venice.ai/api/v1/augment/text-parser \
  -H "Authorization: Bearer $VENICE_API_KEY" \
  -F "file=@document.pdf" \
  -F "response_format=json"
```

기본 `json` 응답 형식은 추출된 텍스트와 토큰 수를 반환합니다. 추출된 텍스트만 필요한 경우 `response_format=text`를 사용하세요.

## Text Parser와 채팅 파일 입력 중 어느 것을 사용해야 할까?

두 기능 모두 문서 내용을 추출하지만 서로 다른 워크플로를 지원합니다:

| 필요 사항                  | 사용 대상                                    |
| ---------------------- | ---------------------------------------- |
| 문서에 대해 모델에 즉시 질문       | [채팅 파일 입력](/guides/features/file-inputs) |
| 추론 없이 텍스트 추출           | Text Parser                              |
| 모델을 선택하기 전에 토큰 수 확인    | Text Parser                              |
| 추출된 콘텐츠를 저장, 색인 또는 재사용 | Text Parser                              |
| 여러 프롬프트에서 동일한 문서 사용    | Text Parser                              |

## 일반적인 파이프라인

<Steps>
  <Step title="파일 파싱">
    원본 문서를 업로드하고 JSON 응답을 요청하세요.
  </Step>

  <Step title="출력 검사">
    토큰 수를 대상 모델의 컨텍스트 창과 비교해 확인하세요. 큰 문서는 추론 전에 다듬거나 분할하세요.
  </Step>

  <Step title="텍스트 사용">
    채팅 프롬프트에 추가하거나, 검색을 위한 임베딩을 생성하거나, 자체 데이터 저장소에 저장하세요.
  </Step>
</Steps>

<Info>
  파싱은 메모리에서 실행되며 데이터가 전혀 보관되지 않습니다. Venice는 업로드된 문서를 처리한 뒤 그 내용을 저장하거나 기록하지 않고 즉시 폐기합니다.
</Info>

<Warning>
  Text Parser API는 실험적 기능입니다. 요청 및 응답 형식은 사전 통지 없이 변경될 수 있습니다.
</Warning>

## 관련 리소스

* [Text Parser API 참조](/api-reference/endpoint/augment/text-parser)
* [파일 입력](/guides/features/file-inputs)
* [임베딩](/guides/features/embeddings)
* [텍스트 모델](/models/text)
