6GB RTX 4050에서 돌려본 20개 소형 LLM 벤치마크
Benchmarks of 20 small LLMs on a 6GB RTX 4050
핵심 요약
6GB VRAM 환경에서 실사용 목적의 소형 LLM 20종을 테스트하고 성능과 효율성을 분석한 리뷰입니다.
- 실사용 중심 테스트 — 일반적인 벤치마크 대신 파일 정리나 로그 분석 등 실제 업무 수행 능력을 검증함
- 6GB VRAM 최적화 — 고사양 장비가 아닌 일반적인 노트북 GPU 환경에서 원활하게 작동하는 모델을 선별함
- 정성적 평가 방식 — 툴 호출, JSON 출력, 지시 이행 등 실무에 필요한 6가지 항목을 기준으로 모델을 평가함
- 추천 모델 선정 — LFM2.5-1.2B와 Granite-4.1-3B를 각각 상시 구동용과 품질 중심 모델로 추천함
내 GPU에서 돌아가면서 실제로 쓸만한 모델을 찾고 있다. 모델들이 다들 쪼만해서 그런지, 아주 작은 차이도 엄청난 개선으로 느껴지더라고.
그래서 LM studio 데이터베이스 들어가서 같은 계열 모델들 변종을 싹 다 뒤져보고, 최대한 최신 모델 위주로 골라봤다. 그다음엔 클로드한테 유명한 벤치마크 좀 뽑아달라고 해서 정성 평가 테스트를 좀 돌려봤지.
이제 실제 상황에서 테스트해 보고 "팀"을 꾸려볼 생각이다.
대부분 사람들은 고사양 장비로 로컬 모델 돌리겠지만, 사실 대다수는 6GB GPU도 간당간당하잖아. 그래서 이 리뷰가 그런 사람들한테 좀 도움이 될 거다.
보고서는 아래와 같다:
문제는 이거다. 6GB 노트북 GPU로 밤새 반복 작업(파일 정리, 태깅, 로그 분류)을 시킬 로컬 모델이 필요하다. 비용은 0원, 개인정보 보호, 속도 제한 없음이 조건이지. 진짜 중요한 건 "어떤 모델이 최고냐"가 아니라 "이 양자화 모델들 중에 내 6GB 환경에서 제대로 돌아가고 내 작업에 잘 맞는 게 뭐냐"는 거다. 리더보드 점수는 아무짝에도 쓸모없다. 걔네는 풀 정밀도 가중치로 돌린 거라, 우리가 실제로 쓰는 Q4/Q6 GGUF랑은 차원이 다르거든.
왜 벤치마크 대신 정성 평가를 했냐고? 6GB GPU 하나로 모델 20개를 BFCL-v3/v4 + IFEval + MMLU까지 다 돌리면 며칠에서 일주일은 걸린다. 게다가 그 데이터는 이미 모델 패밀리별로 다 나와 있잖아. 내가 궁금한 건 내가 필요한 특정 작업에서 이 양자화 모델이 어떻게 행동하느냐다. 그래서 6가지 테스트 항목을 만들었다. (1) 파싱 가능한 툴 호출, (2) 멀티턴 툴 호출(실제 툴 결과랑 연동되는지, 아니면 헛소리하는지), (3) 엄격한 JSON, (4) 지시사항 준수(IFEval 스타일), (5) 계획 분해, (6) 경로 환각 방지, 그리고 GSM8K 스타일 산수 테스트까지. 이걸 직접 눈으로 확인하고 BFCL/IFEval 결과랑 대조해서 양자화로 인한 성능 저하를 잡아냈다. 이렇게 하니까 일주일 걸릴 게 1시간으로 줄더라. 이게 진짜 중요한 거니까. 그다음엔 LM Studio의 OpenAI 호환 API를 써서 1k/8k/32k 컨텍스트에서 프리필(프롬프트 처리) 속도랑 초당 생성 토큰(tok/s)을 5번씩 측정했다.
테스트한 모델 20개: Granite 4.1 3B (lmstudio-community, unsloth, nikolaykozloff Q6/Q8) · Granite-3B-function-calling-xLAM (Salesforce/unsloth) · Granite-3B-sft-claude-opus-reasoning · Granite 4.1 8B · Granite 4.1 8B base · LFM2.5-8B-A1B (liquidai official, unsloth, RemySkye-i1) · Gemma-4-e2b (google base, agentic, ×opus-4.7-turbo, ×deepseek-v4) · LFM2.5-1.2B-Instruct · LFM2.5-VL-1.6B (liquidai, unsloth) · Qwen3.5-4B (base, claude-4.6-opus-reasoning-distilled) · Nemotron-3-Nano-4B.
결과 (gen tok/s, N=5, σ Model VRAM @1k @8k @32k Max ctx (GPU) Note lfm2.5-1.2b-instruct 1.9G 129 118 102 256k clean, fast unsloth/lfm2.5-vl-1.6b 3.0G 207 182 142 128k fastest overall (vision) liquidai/lfm2.5-vl-1.6b 2.7G 128 115 100 256k vision liquidai/lfm2.5-8b-a1b 5.4G 99 97 90 64k MoE, holds 32k well unsloth/lfm2.5-8b-a1b 4.6G 121 112 102 128k fast but drops files lfm2.5-8b-a1b-i1 5.4G 108 99 95 32k reasoning variant gemma-4-agentic-e2b 2.4G 82 78 70 256k lightest, holds 32k google/gemma-4-e2b (base) 3.6G 78 79 69 256k base, noisy gemma-4-e2b×opus-turbo 2.4G 82 78 71 256k broken chat template gemma4-e2b-deepseek 2.4G 83 78 71 256k hallucinated paths unsloth/granite-4.1-3b 4.8G 70 60 40 32k quality ≈ 8B granite-3b-xLAM (fc) 4.8G 71 61 41 32k no edge vs base 3B lmstudio/granite-4.1-3b 4.9G 66 59 42 32k solid baseline granite-3b-sft-reasoning 4.8G 68 58 39 32k reasoning tax nikolaykozloff/granite-3b 4.6G 45 40 — 24k hallucinated fn name nvidia/nemotron-3-nano-4b 3.7G 58 56 48 128k
