K2 Horizon 라인업이 AA에 공개됐는데, AA 차트는 또 오해의 소지가 있네.
K2 Horizon lineup is out on AA, and once again AA plots are misleading.
핵심 요약
K2 Horizon 모델들의 성능은 좋지만, 비효율적인 KV 캐시 설계로 인해 실제 VRAM 요구량이 과도하게 높다는 분석입니다.
- 성능 지표 — AA 차트상 3.7B와 7B 모델은 SOTA급 성능을 보여줌
- KV 캐시 문제 — 모델들의 KV 캐시 설계가 비효율적이라 VRAM을 지나치게 많이 점유함
- 하드웨어 제약 — 16GB VRAM 환경에서는 경쟁 모델 대비 효율성이 떨어짐
- 대안 모델 — VRAM이 부족한 환경에서는 Qwen이나 다른 경량 모델이 더 나은 선택지임
Artificial Analysis에 K2 Horizon 전체 라인업 떴다.
AA의 지능 vs 파라미터 그래프를 보면 대충 이렇다.
- 0.9B랑 375B는 그냥 쓰레기임
- 3.7B랑 7B는 SOTA 찍음
- 36B A4B는 메모리 대역폭 씹창난 하드웨어(spilled experts, Strix Halo, DGX Spark)에서 SOTA임.
AA Intelligence Index는 일단 액면 그대로 받아들이기로 했다. 이 글은 그거 분석하는 글 아니니까.
문제는 이 모델들 KV 캐시 설계가 진짜 개판이라는 거다. 그래서 파라미터 수만 보고 "동급 최강" 따지는 건 의미가 없음. 그래프 X축을 파라미터 수 대신 RAM 요구량으로 바꾸면 이 모델들은 오른쪽으로 한참 밀려나거든.
Q4_K_M 가중치 기준, drafter 없고, 비전 없고, 128k kvarn4 KV 캐시 썼을 때:
-
K2 Horizon 36B-A4B: dense 가중치 2 GiB, expert 19 GiB, 컨텍스트 6.7 GiB 처먹음
-
K2 Horizon 7B: 가중치 5.2 GiB, 컨텍스트 5 GiB 처먹음
-
K2 Horizon 3.7B: 가중치 2.9 GiB, 컨텍스트 5 GiB 처먹음 (복붙 오류 아님!)
비교해보면:
-
(파인튜닝된) Qwen3.6-35B-A3B: dense 가중치 2.4 GiB, expert 18.2 GiB, 컨텍스트 0.7 GiB
-
MiniCPM5-2B: 가중치 1.5 GiB, 컨텍스트 1.5 GiB
참고: 2~4B 모델을 Q4로 압축하는 건 비추고, 이 모델들이 가중치나 KV 캐시 양자화에 얼마나 버티는지는 아직 테스트 안 해봤다. 그냥 비교 공정하게 하려고 저렇게 맞춘 거임.
이 개판인 컨텍스트 설계 때문에 결론은 이거다.
-
K2 Horizon 36B A4B는 VRAM 딱 16GB에 호스트 RAM 최소 32GB인 환경에서나 좀 쓸만함. VRAM 24GB면 그냥 Qwen3.8-27B 쓰는 게 훨씬 빠르고 똑똑하고 256k 컨텍스트까지 지원함. VRAM 거지인데 256k 컨텍스트 쓰고 싶으면 차라리 Ornith-1.5나 Nex-N2.5-mini가 낫다. 64GB Strix Halo 쓰는 애들한테는 Qwen3.8-27B보다 멍청하지만 더 빠른 대안으로 고려해볼 만함. 128GB Strix Halo 박은 놈들은 그냥 Qwen3.8-Flash-Next 쓰는 게 정신 건강에 이롭다.
-
K2 Horizon 7B는 VRAM 딱 16GB인 환경, RAM 32GB짜리 Strix Halo, 아니면 16/32GB Strix Point에서나 좀 쓸만함.

