긴 문서(차트, 이미지, 표 포함) QA를 위한 Vision LLM과 OCR 파이프라인 비교
Vision-capable LLMs vs. OCR for long-document (including charts, images, tables, etc.) QA
핵심 요약
이미지가 많은 긴 문서 QA에서 Vision LLM이 OCR 기반 방식보다 정확도가 낮고 비용은 더 많이 든다는 벤치마크 결과입니다.
- 벤치마크 수행 — MMLongBench-Doc 데이터셋의 이미지 중심 PDF 30개를 대상으로 Vision LLM과 OCR 파이프라인을 비교함.
- 성능 비교 — Vision LLM은 정확도 6개 방식 중 5위에 그쳤으며, 비용은 가장 비싼 것으로 나타남.
- OCR의 우위 — 차트와 표가 많은 문서에서 프리미엄 OCR이 레이아웃 추출을 통해 더 나은 성능을 보임.
- 안정성 차이 — Native PDF 방식은 파일 크기 문제로 7%의 실패율을 보인 반면, OCR 방식은 실패율 0%를 기록함.
이미지가 많은 긴 문서(차트, 이미지, 표 등 포함)를 대상으로 Vision LLM(PDF를 그대로 첨부하여 모델이 읽게 하는 방식)과 OCR 기반 파이프라인을 비교 벤치마크했습니다. MMLongBench-Doc(https://github.com/mayubo2333/MMLongBench-Doc)의 이미지 중심 PDF 30개를 사용했으며, Claude Sonnet 4.5를 LLM으로 활용해 총 171개의 질문을 던졌습니다.
재시도 후 결과는 다음과 같습니다:
| Approach | Accuracy | $/query |
|---|---|---|
| LlamaCloud premium + full-context | 59.6% | $0.1885 |
| Azure premium + full-context | 58.5% | $0.2051 |
| Azure basic + full-context | 54.4% | $0.1062 |
| Agentic RAG | 53.2% | $0.0827 |
| Native PDF (vision LLM) | 52.0% | $0.2552 |
| LlamaCloud basic + full-context | 50.9% | $0.1049 |
Native PDF 방식은 정확도 면에서 6개 방식 중 5위를 차지했으며, 쿼리당 $0.2552로 가장 비싼 비용이 들었습니다.
두 가지 주요 발견 사항:
Vision 모델은 "Vision LLM이 OCR을 대체한다"는 주장이 가장 자주 언급되는 영역인 차트와 표가 많은 페이지에서 성능이 저조했습니다. 레이아웃 추출을 포함한 프리미엄 OCR이 해당 영역에서 더 나은 성능을 보였습니다.
Native-PDF 방식은 재시도 후에도 7%의 고유 실패율(PDF 파일 크기와 관련)을 보였습니다. 27번의 1차 실패가 있었고, 실패한 쿼리당 5번의 지수 백오프(exponential backoff) 시도를 수행했습니다. 15번은 복구되었으나 12번은 영구적으로 실패했습니다. 이는 예측 가능한 전송 계층 문제로 인해 실패하는 특정 PDF 2개에 집중되었습니다. 반면 OCR 기반 방식은 재시도 후 0%의 고유 실패율을 보였습니다.
주의 사항: 30개의 문서는 표본이 작습니다. McNemar의 쌍체 검정을 수행하여 어떤 격차가 실제 유의미한지, 어떤 것이 노이즈 범위 내에 있는지 확인했습니다. 15개의 직접 비교 중 3개만이 α = 0.05 수준에서 통계적으로 구분 가능했으므로, 표의 순서는 부분적으로 노이즈가 섞여 있습니다. 하지만 Vision 대 OCR의 결과는 검정을 통과했습니다.

