2026년 4B 모델 클래스 벤치마크
The 4B class of 2026 (benchmark)
핵심 요약
4B급 소형 모델 5종을 대상으로 금융, 추론, 코딩 능력을 벤치마크한 결과, NVIDIA의 Nemotron 3 Nano가 압도적인 성능을 보임.
- 벤치마크 대상 — 4B급 소형 모델 5종(Gemma 4, Qwen 3.5, Granite 4, Nemotron 3 Nano, Phi 4 mini)을 동일한 작업으로 비교함.
- 모델별 특성 — Nemotron은 추론에, Granite는 코딩에 강점을 보이는 등 모델마다 명확한 전문 분야가 확인됨.
- 토큰 예산 문제 — Qwen 3.5와 같은 사고형 모델이 고정된 토큰 예산 내에서 답변을 완료하지 못해 성능이 저하되는 현상이 발생함.
- 향후 계획 — 모델별로 최적화된 토큰 예산을 적용하여 3차 벤치마크를 진행할 예정임.
내 18GB M3 Pro로 돌린 두 번째 벤치마크임. 지난주에는 7-8B급 모델들로 전문가 vs 일반 모델 대결을 했는데, 사고형 모델에 128 토큰 예산을 줘서 망치는 바람에 포스트 절반이 사과문이었음. 이번 주는 2026년 4B 클래스임. 3-4B 사이즈에서 출시되었거나 현재 활발히 쓰이는 모든 모델을 같은 작업 세트로 정면 대결시킴.
라인업 (디스크 용량):
gemma4:e4b 9.6 GB Google, Apr 2 2026
qwen3.5:4b 3.4 GB Alibaba, Mar 1 2026
granite4:3b 2.1 GB IBM, Oct 2025
nemotron-3-nano:4b 2.8 GB NVIDIA, Mar 2026
phi4-mini:3.8b 2.5 GB Microsoft, late 2024
39개 작업: 금융 15개(P/E, NPV, CAGR, Sharpe), 추론 15개(단어 문제, 삼단논법, 확률), 코딩 9개(FizzBuzz 수준). (모델 × 작업)당 3회 시행, 중앙값 산출. temp=0, seed=42, max_tokens=1024.
헤드라인: Nemotron 3 Nano가 압도적으로 우승함
model overall finance reasoning code
nemotron-3-nano:4b 85% 100% 80% 67%
phi4-mini:3.8b 77% 80% 60% 100%
gemma4:e4b 62% 60% 60% 67%
granite4:3b 54% 60% 20% 100%
qwen3.5:4b 15% 20% 20% 0%
NVIDIA의 나노 모델은 출시된 지 겨우 한 달 됐는데 금융 문제 15개를 전부 맞힘. 응답을 보면(gist에서 확인 가능), </think> 태그를 사용하는 사고형 모델인데 1024 토큰 예산 안에서 사고를 끝냄. 추론 과정도 깔끔함: "(1.08)^5 계산. 1.08^2=1.1664, ^3=1.259712, ^4=1.36048896, ^5=1.4693280768. 따라서 PV = 100,000 / 1.4693280768 = 약 68,058."
디스크 용량 2.8GB짜리 모델이 정확한 중간 과정과 정답을 내놓음. 특히 금융 분야에서는 더 큰 모델들을 전부 이겼음.
이 사이즈에서도 모델별 성격은 확실함
granite4:3b와 nemotron-3-nano:4b의 카테고리별 성적을 보셈:
granite: code 100%, reasoning 20%
nemotron: code 67%, reasoning 80%
둘 다 3-4GB급 모델인데 성향이 정반대임. Granite는 추론이 약한 코딩 전용 모델이고, Nemotron은 코딩은 평범하지만 추론 전용 모델임. 두 모델 모두 이 사이즈에서 범용 모델로 마케팅되지만, 데이터는 명확한 전문화를 보여줌.
phi4-mini는 그 중간임: 코딩 100%, 금융 80%, 추론 60%. 가장 균형 잡힌 모델이고 디스크 용량 대비 정확도(GB당 30.8%) 면에서 가성비 최고임.
Qwen 3.5 4b의 문제
정확도 15%. 39개 응답 중 30개가 비어있음(평균 응답 길이: 1024 토큰 중 21자). 4개월 전 벤치 1에서 Qwen3:4b가 보여준 실패 모드와 같음. 비사고형 모델에 적절한 고정 예산 안에서 사고를 끝내지 못하는 사고형 모델임.

