> ## Documentation Index
> Fetch the complete documentation index at: https://veniceai-mintlify-86b9f77a.mintlify.site/llms.txt
> Use this file to discover all available pages before exploring further.

# 문서 처리

> Venice Text Parser API로 문서에서 텍스트와 토큰 수를 추출한 뒤, 프롬프트, 임베딩, 데이터 파이프라인에서 재사용하세요. PDF, DOCX, PPTX, XLSX와 최대 25 MB 텍스트 파일을 /augment/text-parser로 파싱합니다.

Text Parser API는 모델 추론을 실행하지 않고 문서에서 텍스트를 추출합니다. 모델로 전송하기 전에 애플리케이션에서 문서 내용을 검사, 저장, 색인, 또는 재사용해야 할 때 사용하세요.

지원되는 입력에는 PDF, DOCX, PPTX, XLSX 및 최대 25 MB의 일반 텍스트 파일이 포함됩니다.

## 문서 파싱

파일을 `multipart/form-data`로 업로드하세요:

```bash theme={null}
curl https://api.venice.ai/api/v1/augment/text-parser \
  -H "Authorization: Bearer $VENICE_API_KEY" \
  -F "file=@document.pdf" \
  -F "response_format=json"
```

기본 `json` 응답 형식은 추출된 텍스트와 토큰 수를 반환합니다. 추출된 텍스트만 필요한 경우 `response_format=text`를 사용하세요.

## Text Parser와 채팅 파일 입력 중 어느 것을 사용해야 할까?

두 기능 모두 문서 내용을 추출하지만 서로 다른 워크플로를 지원합니다:

| 필요 사항                  | 사용 대상                                    |
| ---------------------- | ---------------------------------------- |
| 문서에 대해 모델에 즉시 질문       | [채팅 파일 입력](/guides/features/file-inputs) |
| 추론 없이 텍스트 추출           | Text Parser                              |
| 모델을 선택하기 전에 토큰 수 확인    | Text Parser                              |
| 추출된 콘텐츠를 저장, 색인 또는 재사용 | Text Parser                              |
| 여러 프롬프트에서 동일한 문서 사용    | Text Parser                              |

## 일반적인 파이프라인

<Steps>
  <Step title="파일 파싱">
    원본 문서를 업로드하고 JSON 응답을 요청하세요.
  </Step>

  <Step title="출력 검사">
    토큰 수를 대상 모델의 컨텍스트 창과 비교해 확인하세요. 큰 문서는 추론 전에 다듬거나 분할하세요.
  </Step>

  <Step title="텍스트 사용">
    채팅 프롬프트에 추가하거나, 검색을 위한 임베딩을 생성하거나, 자체 데이터 저장소에 저장하세요.
  </Step>
</Steps>

<Info>
  파싱은 메모리에서 실행되며 데이터가 전혀 보관되지 않습니다. Venice는 업로드된 문서를 처리한 뒤 그 내용을 저장하거나 기록하지 않고 즉시 폐기합니다.
</Info>

<Warning>
  Text Parser API는 실험적 기능입니다. 요청 및 응답 형식은 사전 통지 없이 변경될 수 있습니다.
</Warning>

## 텍스트를 레코드로 만들기

추출된 텍스트는 결과가 아니라 시작점입니다. [문서에서 구조화된 데이터 추출하기](/guides/tools/document-extraction)는 여기서부터 이어집니다. 모든 문서가 동일한 필드를 생성하도록 출력을 JSON 스키마에 고정하고, 파서가 파일에 추출할 텍스트가 없다고 보고하면 비전 모델로 전환하는 방법을 다룹니다.

## 관련 리소스

* [문서에서 구조화된 데이터 추출하기](/guides/tools/document-extraction)
* [Text Parser API 참조](/api-reference/endpoint/augment/text-parser)
* [파일 입력](/guides/features/file-inputs)
* [임베딩](/guides/features/embeddings)
* [텍스트 모델](/models/text)
