Parse Document
LLM 기반 문서 파서로, 선택적 OCR 병행을 통해 비정형 문서를 markdown으로 추출한다. 캔버스 라벨은 Parse Document Operator이며, PDF / PPTX / DOCX / XLSX 등의 파일을 LLM이 사용할 수 있는 markdown으로 변환한다.
사용 시점
매뉴얼, 계약서, 보고서, 스캔본 등 비정형 문서를 후속 LLM Operator나 정형 적재 노드에서 활용하려 할 때 사용한다.
설정
| 필드 | 필수 | 설명 |
|---|---|---|
| Parser Model | Yes | 사용 가능한 LLM 모델 중에서 선택한다. |
| Enable OCR | No | 토글. 기본 LLM 단독 / OCR + LLM 병행 중 선택한다. 스캔본·이미지 중심 문서일 때 켠다. |
사용 전 확인
- 다음 노드와 연결되어 있어야 한다.
- Parser Model을 선택해야 한다.
출력 / 후속 단계
- 본 노드는 일반적인 dataframe이 아니라 비동기 파싱 잡을 생성한다.
- 결과 파일은 다음 단계의 LLM Operator에서 사용할 파일을 선택해 사용한다.
Parse Document는 비동기 잡으로 실행된다. 일반 데이터 프리뷰와 다르게 동작하므로, 결과 확인과 디버깅은 Parse Outputs 화면에서 수행한다.
권장 체인
Retrieve Data >> Parse Document >> LLM Operator >> Object Creation (또는 Upsert Knowledge)전체 흐름과 단계별 역할은 Parse Pipeline 구성 참고.
Last updated on