툴 호출과 128K 컨텍스트를 지원하는 2.6B 모델, 이제 스마트폰에서 초당 30토큰 속도로 구동
A 2.6B model with tool calling and 128K context now runs at 30 tok/s on a phone
핵심 요약
Liquid AI의 신규 2.6B 모델이 뛰어난 툴 호출 성능과 효율적인 로컬 구동 능력을 보여주며 주목받고 있습니다.
- 모델 사양 — 2.69B 파라미터에 128K 컨텍스트를 지원하며 툴 호출에 최적화됨
- 성능 지표 — 스마트폰에서 30 tok/s, M5 Max에서 220 tok/s의 빠른 속도 기록
- 벤치마크 결과 — 9B급 모델과 경쟁 가능한 수준이나 코딩 작업에는 한계 존재
- 실제 활용도 — 스마트 어시스턴트보다는 데이터 추출이나 파일 작업 등 보조 에이전트로 적합
Liquid AI가 오늘 LFM2.5-2.6B를 출시했는데, 대부분의 사람이 실행조차 할 수 없는 거대한 모델들보다 로컬 AI에 더 적합할지도 모르겠습니다.
이 모델은 파라미터가 2.69B에 불과하고 128K 컨텍스트를 지원하며, 툴 호출을 지원하고 다단계 에이전트 워크플로우를 위해 특별히 사후 학습되었습니다. 공식 Q4_K_M GGUF는 약 1.67GB이며 이미 llama.cpp와 호환됩니다.
제공된 CPU 속도:
- 스마트폰에서 30 tok/s
- Ryzen AI Max+ 395에서 113 tok/s
- M5 Max에서 220 tok/s
- 테스트 중 2.5GB 미만의 메모리 사용
이것들은 벤더 측 벤치마크이므로 독립적인 결과가 분명히 필요합니다.
벤치마크 결과는 크기에 비해 놀라울 정도로 경쟁력이 있습니다:
- ToolSandbox: 77.83 (Qwen3.5-9B의 76.44와 비교)
- IFBench: 59.17 (Qwen3.5-9B의 56.47과 비교)
- BFCLv4: 56.88 (Qwen3.5-9B의 60.13보다는 낮음)
- LiveCodeBench: 59.41 (Qwen3.5-9B의 69.86과 비교)
따라서 이 모델이 더 큰 모델들을 마법처럼 대체하는 것은 아닙니다. 코딩과 지식 집약적인 작업은 여전히 약점이며, Liquid의 자체 모델 카드에서도 에이전트 코딩용으로는 권장하지 않는다고 명시되어 있습니다.
하지만 저는 이런 점이 작은 로컬 모델들이 실제로 의미를 갖는 지점이라고 생각합니다. 가장 똑똑한 어시스턴트가 아니라, 로컬에서 데이터 추출, 검색, 파일 작업 및 반복적인 툴 호출을 수행하는 저렴한 작업자 에이전트로 사용하는 것이죠. 작은 모델이 막힐 때만 더 큰 모델이 계획을 담당하게 할 수 있습니다.
128K 지원 주장 또한 실제 테스트가 필요합니다. 128K를 지원하는 것과 스마트폰에서 KV 캐시와 긴 에이전트 기록을 포함해 쾌적하게 실행하는 것은 완전히 다른 문제입니다.
혹시 안드로이드, 구형 노트북, 혹은 미니 PC에서 Q4 GGUF를 테스트해 본 분 계신가요? 하드웨어 사양, 컨텍스트 크기, 실제 tok/s, 그리고 10회 이상의 연속적인 툴 호출을 오류 없이 수행할 수 있는지 확인해 보면 유용할 것 같습니다.


