최고의 임베딩 + 리랭킹 모델 추천
Best Embedding + Reranking Model
핵심 요약
번역 메모리 서버를 위한 최적의 로컬 임베딩 및 리랭킹 모델 조합과 벤치마크 결과를 공유함.
- 최적의 조합 — F2LLM V2:4b와 Zerank 2:4b 조합이 압도적인 성능을 보임
- 벤치마크 결과 — MRR 0.919 및 R@20 98.4%로 상위권 성능 기록
- 모델 운영 — 모든 로컬 모델은 Llama CPP Q8_0 양자화 환경에서 실행됨
- 오픈 소스 기여 — Notion이 인수한 Zeroentropy의 Zerank 2가 오픈 소스로 공개됨
다들 RAG 돌릴 때 어떤 로컬 임베딩이랑 리랭킹 모델 쓰냐?
번역 메모리 서버에 쓸 임베딩 모델이랑 리랭커 찾다가 이 짓거리에 제대로 발 담그게 됐다.
핵심은 이거임. 영어로 된 X 구문/단어/문장/문단이 주어졌을 때, 이미 번역된 타겟 언어에서 비슷한 놈을 찾아낼 수 있냐는 거지. 서구권이랑 동양권 언어 15개 정도를 다뤄야 함.
이 용도로는 F2LLM V2:4b + Zerank 2:4b 조합이 시장에 있는 다른 거 다 씹어 먹는다. 내가 돌려본 벤치마크 결과는 이거임:
| Embed Model | Reranker Model | MRR | Re-Δ | R@20 |
|---|---|---|---|---|
| BGE M3 0.6B | BGE M3 Reranker V2 0.6B | 0.821 | -1.60% | 91.90% |
| BGE M3 0.6B | Qwen 3 Reranker 0.6B | 0.776 | -7.50% | 91.90% |
| F2LLM 1.7B | Zerank 1 1.7B | 0.871 | -2.20% | 96.80% |
| Qwen 3 Embed 4B | Qwen 3 Reranker 4B | 0.739 | 11.00% | 77.50% |
| Zembed 4B | Zerank 2 4B | 0.664 | 25.80% | 67.10% |
| F2LLM 4B | Zerank 2 4B | 0.919 | 2.40% | 98.40% |
| F2LLM 8B | Zerank 2 4B | 0.922 | 1.60% | 99.20% |
| PPLX Embed V1 4B | Zerank 2 4B | 0.8825 | 10.10% | 91.90% |
| Octen Embed 4B | Zerank 2 4B | 0.853 | 12.40% | 89.00% |
| Voyage 4 Large [API] | Voyage Rerank 2.5 [API] | 0.889 | 8.50% | 94.70% |
여기서 MRR은 Mean Reciprocal Rank, 즉 최종 점수고, Re-Δ는 리랭커가 얼마나 도움 됐는지, R@20은 검색된 20개 항목 안에 정답 번역이 있었는지 나타냄.


