Qwen3.6-35B-A3B - VRAM이 부족한 상황에서도 예상보다 큰 퀀트를 쓰는 게 더 나을 수 있음!
Qwen3.6-35B-A3B - even in VRAM limited scenarios it can be better to use bigger quants than you'd expect!
핵심 요약
VRAM이 부족해도 무조건 작은 퀀트만 고집하지 말고 더 큰 퀀트를 시도해보라는 팁.
- MoE 모델 최적화 — VRAM 제한 상황에서도 더 큰 퀀트를 사용하면 성능과 속도 면에서 이득을 볼 수 있음.
- 퀀트 방식 차이 — 일반 퀀트(K-quants)와 I-퀀트(IQ-quants)의 특성에 따라 VRAM 오프로딩 효율이 달라짐.
- llama.cpp 설정 — 스레드 수와 배치 설정을 조정하여 CPU/GPU 환경에서 최적의 토큰 생성 속도를 확보함.
- 컨텍스트 윈도우 — 128k 컨텍스트에서도 적절한 퀀트 선택 시 준수한 토큰 생성 속도를 유지함.
경험 많은 로컬 LLM 사용자들에겐 당연한 소리일지 모르겠지만, 나한텐 전혀 아니었음.
난 3070 8GB + 64GB DDR4 환경에서 돌리는 중임. 꽤 가벼운 사양이라 제일 작은 Q4 언슬롯 모델인 Qwen3.6-35B-A3B-UD-IQ4_XS.gguf(~18GB)를 골랐음. 잘 돌아가긴 했고, llama.cpp 최적화를 좀 해서 32k 컨텍스트 윈도우로 초당 25~30 토큰 정도 뽑았음.
근데 생각하는 도중에 루프 도는 문제가 좀 있어서 더 큰 Q4 모델인 Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf(~23GB)를 써봤음. 놀랍게도 이게 훨씬 빨랐음! 128k 컨텍스트 윈도우에서 초당 32 토큰이 나옴.
결국 품질이랑 속도 밸런스가 제일 좋은 Q5_K_S로 정착함. 초당 30 토큰 정도 나옴. 아, 128k 컨텍스트 윈도우 쓰는 중임. 긴 컨텍스트에선 속도가 좀 떨어지긴 하는데, 50k 컨텍스트에서도 여전히 25 토큰은 넘음(더 높은 건 아직 테스트 안 해봄).
결론은, 이런 MoE 모델 쓸 땐 예상보다 더 큰 퀀트를 써보라는 거임!
.\llama-server.exe --model "Qwen3.6-35B-A3B-UD-Q5_K_S.gguf" --temp 0.6 --top-p 0.95 --min-p 0.00 --top-k 20 -c 128000 --host 0.0.0.0 --threads-batch 8 --threads 3 --chat-template_kwargs '{"preserve_

