Qwen 35B-A3B 모델, 12GB VRAM에서 아주 쓸만함
Qwen 35B-A3B is very usable with 12GB of VRAM
핵심 요약
12GB VRAM 환경에서 Qwen 35B-A3B 모델을 최적화하여 32k 컨텍스트와 빠른 추론 속도를 확보하는 방법을 공유함.
- VRAM 최적화 — 12GB 환경에서 MoE 블록 오프로드 설정을 통해 32k 컨텍스트와 빠른 속도를 동시에 확보함.
- 성능 벤치마크 — llama-bench와 llama-cli를 활용해 최적의 -ncmoe 값과 KV 캐시 설정을 찾아냄.
- MTP 효율성 — Speculative Decoding(MTP)을 적용했으나 일반 디코딩 대비 속도 향상이 2% 수준으로 미미함.
- 실사용 팁 — 12GB VRAM은 해당 모델을 구동하기에 매우 실용적이며, q8 KV 설정이 성능상 유리함.
하드웨어:
RTX 3060 12GB
32GB DDR4-3200
Windows
CUDA 13.x
모델:
Qwen3.6-35B-A3B-MTP-IQ4_XS.gguf
이 모델은 35B MoE 모델이라서 -ncmoe 설정이 매우 중요함. -ncmoe 값을 낮출수록 더 많은 MoE 블록이 GPU에 상주함.
핵심 요약
12GB VRAM은 이 모델을 돌리기에 매우 실용적인 크기임. GPU에 MoE 블록을 충분히 유지할 수 있어 일반 디코딩 성능이 상당히 강력하며, 16k/32k 같은 유용한 컨텍스트 사이즈를 확보할 공간도 남음.
프롬프트 처리/프리필의 경우, llama-cli의 대화형 Prompt: 라인보다는 llama-bench 수치를 더 신뢰함. llama-bench가 더 깔끔한 pp512 측정값을 제공하기 때문임.
최고의 일반 llama-bench 결과:
-ncmoe 18
-t 9
-ctk q8_0 -ctv q8_0
pp512: ~914 t/s
tg128: ~46.8 t/s
따라서 이 설정에서 원시 프리필 속도는 매우 빠름.
최고의 실사용 코딩 프로필
매일 코딩할 때는 다음 설정을 사용함:
llama-cli.exe ^
-m "Qwen3.6-35B-A3B-MTP-IQ4_XS.gguf" ^
-p "..." ^
-n 512 ^
-c 32768 ^
--temp 0 --top-k 1 ^
-ngl 999 -ncmoe 20 ^
-fa on ^
-ctk q8_0 -ctv q8_0 ^
--no-mmap ^
--no-jinja ^
-t 9 ^
--perf
결과:
Context: 32k
Prompt: ~88.9 t/s in llama-cli
Generation: ~43.4 t/s
VRAM free: ~273 MiB
이 설정은 코딩하기에 충분히 큰 컨텍스트를 제공하면서도 속도가 빠르고, VRAM도 완전히 고갈되지 않는 좋은 균형점임.
더 빠른 16k 프로필
-c 16384 -ncmoe 19 -ctk q8_0 -ctv q8_0 -t 9
결과:
Prompt: ~91.5 t/s in llama-cli
Generation: ~44.5 t/s
VRAM free: ~37 MiB
이 설정이 약간 더 빠르지만, VRAM 한계치에 매우 근접함.
MoE 오프로드 스윕
일반 디코딩, q4 KV, -t 11 기준:
-ncmoe 22: tg128 ~41.6 t/s
-ncmoe 20: tg128 ~41.7 t/s
-ncmoe 19: tg128 ~44.2 t/s
-ncmoe 18: tg128 ~45.9 t/s
-ncmoe 17: tg128 ~46.6 t/s
-ncmoe 16: tg128 ~25.8 t/s <-- 성능 급락 / 너무 과함
따라서 일반 디코딩의 경우:
안전: -ncmoe 18
한계: -ncmoe 17
비추천: -ncmoe 16
KV 캐시 스윕
, 기준:


