7900XTX 24GB VRAM으로 Qwen 3.6 27B 모델 131k 컨텍스트에서 Q6K+MTP 구동 성공
7900XTX 24GB vram, can finally fit Q6K+MTP with Qwen 3.6 27B at 131k context
핵심 요약
7900XTX에서 iGPU 활용 및 KV 캐시 양자화 최적화로 27B 모델의 131k 컨텍스트 구동에 성공했습니다.
- VRAM 최적화 — iGPU를 모니터에 연결해 dGPU VRAM을 100% 확보함
- KV 캐시 양자화 — Q5_0/Q4_0 설정으로 VRAM 사용량을 12% 절감함
- 성능 지표 — 27B 모델 131k 컨텍스트에서 45~60t/s 속도 달성
- 백엔드 설정 — ROCm 대신 Vulkan을 사용하여 효율성 극대화
OS: CatchyOS
Instructions:
모니터를 iGPU에 직접 연결하세요. 그러면 리눅스로 부팅할 때 dGPU VRAM이 100% 비어 있게 됩니다. 기본적으로 dGPU를 사용하면 약 700MB~1.2GB의 컨텍스트 공간이 손실되거든요. 물론 이 방식을 써도 게임은 평소처럼 정상적으로 할 수 있습니다.
kvcache를 q5_0/q4_0으로 설정하세요 (반드시 CUDA_ALL_QUANTS로 컴파일해야 합니다).
네, Q5_0/Q4_0은 Q8보다 정밀도가 1.6% 정도 낮지만, VRAM 사용량은 12% 줄어듭니다. 여기 증거가 있습니다: (Qwen은 kvcache 처리를 아주 잘합니다).
https://anbeeld.com/articles/kv-cache-quantization-benchmarks-for-long-context
이제 Unsloth Q6K 모델(22GB~)인 Qwen 3.6 27B를 131k 컨텍스트에서 55~60t/s로 돌릴 수 있습니다.
컴파일할 때 다음 인자들을 추가하세요 (blas 변경 사항은 VRAM 사용량을 줄이는 데 도움이 된다고 한 사람의 글에서 가져왔는데, 음... 효과가 있네요).
-DGGML_BLAS=ON -DGGML_BLAS_VENDOR=OpenBLAS -DGGML_CUDA_FA_ALL_QUANTS=true
그다음 llama.cpp 인자를 전달하면 됩니다:
-ctk q5_0 -ctv q4_0 --temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.00 --presence-penalty 0.0 --repeat-penalty 1.0 -c 131000 --ninja --mlock --parallel 1 --no-mmproj

