Turbo-OCR 업데이트: 레이아웃 모델 및 다국어 지원 추가
Turbo-OCR Update: Layout Model + Multilingual
핵심 요약
고성능 C++/CUDA 기반 OCR 서버인 Turbo-OCR이 레이아웃 감지 모델과 다국어 지원을 추가했습니다.
- 레이아웃 감지 — PP-StructureV3를 도입하여 문서 레이아웃 분석 기능을 강화함.
- 다국어 지원 — 기존 라틴어 전용에서 한국어, 중국어, 일본어, 키릴 문자, 아랍어 등으로 확장됨.
- 고성능 스택 — TensorRT FP16, gRPC/HTTP, 다중 스트림 처리를 통해 빠른 속도를 제공함.
- 처리 성능 — RTX 5090 환경에서 텍스트가 많은 이미지 기준 초당 100장 이상 처리 가능함.
18일 전 올렸던 C++/CUDA OCR 서버 관련 포스트의 후속 내용입니다. 두 가지가 추가되었습니다.
새로운 기능:
- 레이아웃 모델: 레이아웃 감지를 위해 PP-StructureV3를 추가했습니다.
- 다국어 지원: 더 이상 라틴어 전용이 아닙니다. 이제 중국어, 일본어, 한국어, 키릴 문자, 아랍어 및 라틴어 계열 언어를 지원합니다.
동일한 스택: C++, TensorRT FP16, 멀티 스트림, gRPC/HTTP, 직접 PDF 엔드포인트.
벤치마크 (Linux / RTX 5090 / CUDA 13.2):
* 텍스트가 많은 이미지: 100+ img/s
* 텍스트가 적은 이미지: 1,000+ img/s
* FUNSD 데이터셋 기준 270p/s
