PDF 파싱 기능 14가지를 기준으로 더 많은 파서들을 비교해 봤음
I compared even more parsers on 14 PDF-parsing capabilities using different types
핵심 요약
14가지 PDF 파싱 기능을 기준으로 다양한 파서들의 성능을 비교 분석한 결과 공유.
- 성능 비교 — 8개 파서의 PDF 파싱 능력 및 속도 테스트 진행함.
- Chandra의 우위 — 14개 항목 모두 완벽하게 수행했으나 속도가 느림.
- 필기체 인식 — 대부분의 파서가 필기체에서 고전했으나 Chandra는 뛰어남.
- LightOnOCR-1B — 속도와 성능 면에서 인상적이나 일부 환각 현상 발생.
이전 게시물에서 MinerU, Granite-Docling, PaddleOCR-VL을 비교했었음. 많은 댓글 작성자들이 본인이 좋아하는 파서들을 추가해달라고 해서 그렇게 했음. 상위 모델들을 구분하기 위해 새로운 기능들도 추가함. 비교한 파서 전체 목록은 다음과 같음:
- MinerU 2.5 (1.2B VLM)
- Granite-Docling (258M VLM)
- PaddleOCR-VL (0.9B VLM)
- XBerg 1.0 (텍스트 레이어 파서, CPU)
- HURIDOCS PDLA v0.0.35 (VGT 레이아웃 모델 + Tesseract)
- LiteParse 2.11 (Tesseract 기반, CPU)
- Chandra (Datalab의 OCR 모델)
- LightOnOCR-1B
발견한 점:
- Chandra가 압도적이었음: 14개 항목 모두 완벽. 실제 병합된 셀 HTML 표, 정확한 LaTeX(디스플레이 및 인라인), 1909년 필기체에서 거의 완벽했고, 1904년 페이지의 이탤릭체를 유지한 유일한 파서였음. 얼룩 부분에 대해서도 올바르게 처리함: 추측하는 대신 건너뜀. 단점: L4에서 페이지당 91초 소요.
- 필기체 열은 처참했음. XBerg, LiteParse, PDLA는 노이즈를 출력하거나 아무것도 출력하지 못함(필기체는 전통적인 OCR의 적임). Granite는 원시 DocTag를 출력에 그대로 노출함. PaddleOCR-VL은 대부분 읽어냈지만 "Maude"를 귀족적인 "Maulevrier"로 멋대로 바꿔버림. LightOnOCR은 읽을 수 없는 얼룩 위에 유창하고 자신감 있게 틀린 텍스트를 써버렸는데, 이게 실제 사용 사례에서 가장 걱정되는 실패 유형임.
- LightOnOCR-1B는 크기 대비 인상적임: 실제 LaTeX, 깔끔한 파이프 표, L4에서 페이지당 7.9초 소요. 하지만 한 페이지의 끝부분을 문장 중간에 잘라먹었고 필기체에서 환각(hallucination)을 보임.
이전과 동일한 공개 사항: 원래의 VLM 3개는 hexread.com(내 제품)에서 실행했고, 나머지는 로컬이나 L4에서 실행함.
수정: 소스, 원시 출력물, 테스트 파일 및 스크립트는 참고용으로 이 레포에 있음: alaamroue/pdf-parser-bench

