LiquidAI/LFM2.5-VL-3B · 허깅페이스
LiquidAI/LFM2.5-VL-3B · Hugging Face
핵심 요약
온디바이스 환경에 최적화된 하이브리드 멀티모달 모델 LFM2.5-VL-3B가 공개되었습니다.
- 온디바이스 최적화 — 3.3GB 미만의 메모리로 효율적인 추론 가능
- 멀티모달 기능 — 텍스트와 이미지 처리가 가능하며 SigLIP2 인코더 탑재
- 성능 지표 — M5 Max 기준 228 tok/s의 빠른 추론 속도 제공
- 사용 권장 사항 — 단일 턴 작업, 실시간 객체 탐지 및 OCR 작업에 적합
huggingface.co
원문 사이트로 이동
LFM2.5-VL-3B는 온디바이스 배포를 위해 설계된 하이브리드 모델 제품군인 LFM2.5의 멀티모달 버전이야. LFM2-VL-3B를 기반으로 중간 학습과 후속 학습을 더 거쳤지. LFM2.5-VL-3B는 텍스트와 이미지를 모두 처리할 수 있고, LFM2.5-2.6B 언어 모델을 백본으로 쓰면서 SigLIP2 NaFlex 비전 인코더를 결합했어.
- 더 나은 그라운딩: 자연어 쿼리를 사용한 그라운딩과 객체 탐지 성능이 개선됐어.
- 더 나은 OCR: 레이아웃 주석이 포함된 전체 페이지 OCR을 지원해. 자세한 내용은 layout annotation format을 확인해 봐.
- 효율적인 추론: 3.3GB 미만의 메모리 환경에서 Apple M5 Max 기준 228 tok/s, AMD Ryzen AI Max+ 395 기준 116 tok/s의 속도를 뽑아내.
LFM2.5-VL-3B에 대한 더 자세한 정보는 릴리즈 포스트에서 확인할 수 있어.
모델 상세 정보:
- LM 백본: LFM2.5-2.6B
- 비전 인코더: SigLIP2 NaFlex shape‑optimized 400M
- 어휘 사전 크기: 128,000
- 컨텍스트 길이: 32,768 토큰
- 지원 언어: 영어, 아랍어, 중국어, 프랑스어, 독일어, 이탈리아어, 일본어, 한국어, 포르투갈어, 스페인어, 베트남어, 태국어, 인도네시아어, 힌디어, 러시아어, 폴란드어
- 네이티브 해상도 처리: SigLIP2의 NaFlex를 사용해. 큰 이미지는 겹치지 않는 512×512 패치와 크기가 조정된 전체 이미지 썸네일로 분할돼.
- 생성 파라미터:
- 텍스트:
temperature=0.2,top_k=50,repetition_penalty=1.0 - 비전:
processor_config.json파일을 사용해.
- 텍스트:
단일 턴, 고처리량, 저지연 작업에 쓰는 걸 추천해. 예를 들면 자동차 애플리케이션에서 실시간에 가까운 객체 탐지를 하거나, PDF를 검색 가능한 텍스트로 바꾸기 위해 레이아웃 정보가 포함된 OCR로 스캔 문서를 일괄 처리할 때, 혹은 기기 내에서 메뉴판이나 도로 표지판을 모국어로 번역할 때 아주 좋아.
시각적 웹 디자인이나 설계도에 대한 고도의 기술적 질문에 답하는 것 같은, 긴 컨텍스트와 추론이 빡세게 필요한 작업에는 추천하지 않아.
온디바이스 추론
LFM2.5-VL-3B는 Apple M5 Max에서 228 tokens/s, AMD Ryzen AI Max+ 395에서 116 tokens/s의 속도로 디코딩하고, 메모리는 약 3GB 정도면 충분해. Galaxy S26 Ultra에서도 20 tokens/s가 나오니까 온디바이스로 완벽하게 돌릴 수 있지.
GPU 추론
vLLM을 사용한 단일 NVIDIA H100 환경에서, LFM2.5-VL-3B는 우리가 테스트한 모델 중 가장 높은 출력 처리량을 보여줬어. 높은 동시성 환경에서 초당 약 11K 토큰, 하루에 거의 1B 토큰을 처리하는 수준이야.

