텐센트의 EVIE-8B 및 EVIE-4.5B (고용량 시각 문서 검색 모델)
tencent/EVIE-8B and EVIE-4.5B (High-Capacity Visual Document Retrieval)
핵심 요약
텐센트가 공개한 시각 문서 검색 특화 모델 EVIE-8B와 4.5B의 주요 특징과 성능을 소개함.
- SOTA 검색 성능 — ViDoRe V3 벤치마크에서 업계 최고 수준의 시각 문서 검색 정확도를 달성함.
- 고용량 임베딩 — 4096D 표현을 통해 레이아웃, 표, 차트 등 세밀한 구조 정보를 보존함.
- 효율적 인덱싱 — HAC 기술로 토큰 수를 압축하여 백만 페이지당 3.81 GiB의 낮은 인덱스 용량을 구현함.
- 다국어 지원 — 138개의 다양한 태스크와 4가지 표준 메트릭을 통해 철저한 성능 검증을 마침.
https://huggingface.co/tencent/EVIE-8B
🌟 주요 특징
-
SOTA급 검색 성능: ViDoRe V3에서 nDCG@10 66.75 달성, 업계 최고 수준의 시각적 문서 검색 정확도 보여줌.
-
고용량 4096D 표현력: 토큰별 멀티 벡터 임베딩을 전부 활용해서 레이아웃, 타이포그래피, 차트, 표 구조까지 아주 세밀하게 잡아냄.
-
티처 파운데이션: 가벼운 EVIE-4.5B Prefix-MRL 모델을 위한 용량 인식 관계 및 마진 증류 타겟 제공.
-
138개 멀티 벤치마크 태스크 커버: 4가지 표준 지표(nDCG, Recall, MAP, MRR u/1)를 기준으로 138개 태스크(ViDoRe V1, V2, V3, JinaVDR)에서 빡세게 검증 완료.
https://huggingface.co/tencent/EVIE-4.5B
🌟 주요 특징
-
최상위권 벤치마크 성능: 단일 프로젝션 Prefix-MRL을 사용해 EVIE-8B는 ViDoRe V3에서 66.75, EVIE-4.5B는 66.02 기록.
-
⚡ Prefix-MRL 탄력성: 단일 2048D 선형 프로젝션 사용. 모델 따로 안 바꿔도 런타임에 ${64, 128, 256, 512, 1024, 2048}$ 차원으로 자유롭게 줄여서 쓸 수 있음.
-
📦 초소형 인덱스 (HAC): 학습 필요 없는 계층적 응집 클러스터링(Hierarchical Agglomerative Clustering)으로 토큰 수를 페이지당 약 750개에서 로 압축. 인덱스 저장 용량을 백만 페이지당 까지 줄여버림.


