Skip to Content

Parse Document

LLM 기반 문서 파서로, 선택적 OCR 병행을 통해 비정형 문서를 markdown으로 추출한다. 캔버스 라벨은 Parse Document Operator이며, PDF / PPTX / DOCX / XLSX 등의 파일을 LLM이 사용할 수 있는 markdown으로 변환한다.

사용 시점

매뉴얼, 계약서, 보고서, 스캔본 등 비정형 문서를 후속 LLM Operator나 정형 적재 노드에서 활용하려 할 때 사용한다.

설정

필드필수설명
Parser ModelYes사용 가능한 LLM 모델 중에서 선택한다.
Enable OCRNo토글. 기본 LLM 단독 / OCR + LLM 병행 중 선택한다. 스캔본·이미지 중심 문서일 때 켠다.

사용 전 확인

  • 다음 노드와 연결되어 있어야 한다.
  • Parser Model을 선택해야 한다.

출력 / 후속 단계

  • 본 노드는 일반적인 dataframe이 아니라 비동기 파싱 잡을 생성한다.
  • 결과 파일은 다음 단계의 LLM Operator에서 사용할 파일을 선택해 사용한다.

Parse Document는 비동기 잡으로 실행된다. 일반 데이터 프리뷰와 다르게 동작하므로, 결과 확인과 디버깅은 Parse Outputs 화면에서 수행한다.

권장 체인

Retrieve Data >> Parse Document >> LLM Operator >> Object Creation (또는 Upsert Knowledge)

전체 흐름과 단계별 역할은 Parse Pipeline 구성 참고.

Last updated on