llama-server와 PaddleOCR-VL-1.5를 활용한 도서 OCR 구현
Using PaddleOCR-VL-1.5 with llama-server for book OCR
핵심 요약
llama-server 환경에서 PaddleOCR-VL-1.5를 사용해 복잡한 레이아웃의 도서를 효율적으로 디지털화하는 파이프라인을 소개함.
- OCR 파이프라인 — PaddleOCR-VL-1.5와 llama-server를 결합하여 도서 페이지의 레이아웃, 표, 텍스트를 효과적으로 처리함.
- 구현 환경 — Windows 환경에서 Vulkan 백엔드를 사용하여 llama-server를 구동하고 자동화된 OCR 프로세스를 구축함.
- 자동화 기능 — 폴더 단위의 페이지 사진을 한 번의 명령어로 Markdown 및 HTML 표 형식으로 변환함.
- 오픈소스 공유 — 해당 OCR 도구의 전체 파이프라인을 GitHub 저장소를 통해 공개함.
llama.cpp의 server를 통해 PaddleOCR-VL-1.5를 실행하여 도서 페이지 OCR을 수행하고 있습니다. 복잡한 레이아웃, 표, 텍스트와 그림이 섞인 페이지를 놀라울 정도로 잘 처리합니다.
설정:
- 모델: PaddleOCR-VL-1.5-GGUF + mmproj.gguf
- 백엔드: llama-server (Windows 환경의 Vulkan)
- 파이프라인: 레이아웃 감지 → 영역 OCR → Markdown 및 HTML 표 변환
이 파이프라인은 페이지 사진이 담긴 폴더 전체를 처음부터 끝까지 처리할 수 있습니다. 기본적으로 명령어 하나로 책 한 권을 디지털화할 수 있습니다.
저장소: https://github.com/akmalayari/ocr-book
혹시 OCR을 위해 비전-언어 모델(Vision-Language Models)을 실험해 보신 분 계신가요?


