Nanbeige4.2-3B: 실망스럽네요
Nanbeige4.2-3B: I'm not impressed
핵심 요약
벤치마크 점수는 높지만, 실제 코딩 작업에서는 속도와 정확도 모두 기대에 미치지 못하는 모델입니다.
- 모델 성능 — 벤치마크는 뛰어나지만 실제 코딩 작업에서는 실패함
- 구조적 문제 — 레이어를 두 번 통과하는 루프 구조로 인해 속도가 느리고 KV 캐시 소모가 큼
- 도구 호출 — 도구 호출(tool calling) 기능만큼은 매우 안정적임
- 비효율성 — 작업당 소요 시간과 VRAM 점유율 면에서 비효율적임
Nanbeige-4.2-3B 테스트해 봤다. 벤치마크 수치만 보면 Qwen3.5-9B나 Gemma4-12B는 그냥 압살하는 수준이더라.
내 목표는 Qwen3.6-35B(혹은 그 파인튜닝 버전들)를 대체할, 간단하고 직관적인 코딩 작업용으로 가볍고 빠른 모델을 찾는 거였다. 예전에 Qwen3.5-9B를 써보려고 다운그레이드 시도해 봤는데, 도저히 실사용할 수준이 안 돼서 포기했었지.
현재 이 모델이 llamacpp 마스터 브랜치에서 깨져 있는데, 이 PR로 해결 가능하다:
https://github.com/ggml-org/llama.cpp/pull/26324
문제 해결하고 좀 굴려봤는데, 솔직히 전혀 감흥 없다.
일단 이 모델은 루프 모델이다. 모든 레이어를 두 번씩 돈다는 소리임. 즉, 이론상으로는 6B 모델 수준의 속도와 컨텍스트 사이즈를 가진다는 뜻이다. Q6 양자화로 돌려도 Q4랑 용량 차이가 거의 안 나는 건 좋은데, 문제는 모델 사이즈에 비해 컨텍스트가 미친 수준이라 KV 캐시 양자화를 엄청 빡세게 안 하면 감당이 안 된다는 거다. 128k 컨텍스트(kvarn3 t2048)가 5.2GB나 처먹는데, 이거 진짜 빡빡하고 성능 저하 없이 쓸 수 있는 마지노선이거든. 이 사이즈 모델치고는 너무 거대하다. 256k kvarn5는 가중치랑 바탕화면 점유율까지 고려하면 16GB VRAM에 절대 안 들어감.
이 모델도 Laguna-S-2.1이 벤치마크 점수 잘 뽑으려고 쓴 "꼼수"를 그대로 쓴다. 벤치마크 측정 기준인 [max] 사고 레벨로 두면, 생각하고 또 생각하고 끝도 없이 생각만 한다. 그래서 작업당 소요 시간(wall time)이 더럽게 느린 건 둘째치고, 간단한 작업인데도 컨텍스트 예산을 순식간에 다 써버림.
AGENTS.md랑 스킬셋 잘 갖춰진 프로젝트에서 아주 쉽고 뻔한 유지보수 작업 두 개를 시켜봤는데, 둘 다 개같이 실패했다.
그나마 칭찬할 점은 툴 콜링(tool calling) 하나는 기가 막히게 잘 된다는 거다. 위에 언급한 llamacpp PR 적용하고 나니까 툴 콜링은 단 한 번도 안 틀리더라.
그래서 Qwen3.5 9B보다 나은가? 잘 모르겠다. 나도 걔한테 하도 데여서, 쉬운 작업도 계속 틀려먹는 모델들 사이에서 뭐가 더 나은지 구분하기가 힘들다. 참고로 Nanbeige는 (128k 기준) 메모리 점유율이랑 속도가 Qwen이랑 똑같다.
작업당 소요 시간으로 따지면, 전문가 모델을 호스트 메모리로 넘긴 Qwen3.6-35B-A3B가 훨씬 빠르고 결과물도 정확하게 뽑아준다.
작은 모델을 원한다고? 이건 좋은 선택이 아니다(디스크 용량은 작지만 VRAM은 엄청 처먹음).
빠른 모델을 원한다고? 이것도 아니다. tok/s 말고 작업당 소요 시간으로 측정해 보면 답 나옴.
아주 쉬운 작업에 정확하고 믿을만한 모델을 원한다고? 이것도 역시 아니다.

