Qwen 3.6 35B A3B: 6GB VRAM에서 131K 컨텍스트 + 비전 구동하기
Qwen 3.6 35B A3B: 131K context + vision on 6GB VRAM
핵심 요약
RTX 2060 6GB 환경에서 CPU 오프로딩 기법을 활용해 35B 모델을 131K 컨텍스트로 구동하는 최적화 설정 공유.
- CPU 오프로딩 — 비전 프로젝터와 MoE 레이어를 CPU로 돌려 VRAM 사용량을 5.2GB로 제한함
- 성능 최적화 — 131K 컨텍스트에서도 쾌적한 프리필 및 디코드 속도를 유지함
- 하드웨어 설정 — RTX 2060 6GB와 32GB RAM 조합으로 대규모 모델 구동 성공
- 커뮤니티 팁 — KV 캐시 양자화 및 컨텍스트 분리 운영을 통한 성능 개선 제안
RTX 2060 6GB + 32GB DDR4 RAM 환경에서 llama.cpp로 HauhauCS/Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive Q4_K_M 모델 돌려봤는데, 프리필(prefill)은 초당 약 600 토큰, 디코드(decode)는 초당 23 토큰 정도 나오고, 131k 컨텍스트 윈도우에 Q8 KV 캐시까지 먹였음.
KV 캐시 비어있을 때는 프리필 600 토큰/초, 디코드 23 토큰/초 정도로 시작함. 컨텍스트 쌓이면 좀 느려지는데, 90k 정도 되면 프리필 485 토큰/초, 디코드 15 토큰/초 수준에서 안정화됨.
비전 프로젝터는 CPU로 돌렸고(--no-mmproj-offload), 덕분에 VRAM 사용량 5.2GB 아래로 유지하면서 OOM이나 GPU 뻗는 거 방지했음. CPU로 돌리면 이미지 인코딩은 좀 느려지는데, 대신 VRAM 1GB 정도 아낄 수 있음.
MoE 전문가 레이어 대부분도 CPU로 돌렸는데(--n-cpu-moe 39), 35B 모델을 6GB VRAM에 꾸역꾸역 집어넣은 비결이 이거임.
실행 명령어:
@echo off
cd /d "%~dp0"
"%~dp0llama-server.exe" ^
\-m "C:\\Qwen3.6-35B-A3B-Uncensored-Q4\_K\_M\\Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-Q4\_K\_M.gguf" ^
\--mmproj "C:\\Qwen3.6-35B-A3B-Uncensored-Q4\_K\_M\\mmproj-Qwen3.6-35B-A3B-Uncensored-HauhauCS-Aggressive-f16.gguf" ^
\--no-mmproj-offload ^
\-ngl 99 ^
\--n-cpu-moe 39 ^
\-c 131072 ^
\-np 1 ^
\-t 6 ^
\-tb 10 ^
\-b 2048 ^
\-ub 2048 ^
\-fa on ^
\-ctk q8\_0 ^
\-ctv q8\_0 ^
\--load-mode mmap+mlock ^
\--jinja ^
\--reasoning-format deepseek ^
\--reasoning-preserve ^
\--spec-type none ^
\--image-min-tokens 1024 ^
\--temp 0.6 ^
\--top-p 0.95 ^
\--top-k 20 ^
\--min-p 0 ^
\--alias Qwen3.6-35B-A3B-Uncensored-Q4\_K\_M ^
\--host 127.0.0.1 ^
\--port 8081
pause
하드웨어: RTX 2060 6GB + 32GB DDR4 RAM + i5-10400F CPU
컨텍스트: 131072 토큰, Q8_0 KV 캐시
도움 됐으면 좋겠네. 혹시 실행 명령어 더 최적화할 팁 있으면 댓글로 좀 알려줘. 난 이제 더 이상 생각나는 게 없다 :D

