16GB RX 7800 XT에서 100K 컨텍스트로 Qwen 3.8 27B Q4 구동 가이드
Qwen 3.8 27B Q4 with 100K context on a 16 GB RX 7800 XT guide
핵심 요약
16GB VRAM 환경에서 Qwen 3.8 27B 모델을 100K 컨텍스트로 구동하는 최적화 설정 공유.
- Vulkan 최적화 — llama.cpp를 Vulkan으로 빌드하여 AMD GPU에서 효율적인 구동 지원
- 메모리 관리 — KV 캐시 양자화(q8/q5)를 통해 16GB VRAM 내에서 대규모 컨텍스트 확보
- 성능 공유 — 100K 컨텍스트 환경에서 초당 약 30 토큰의 디코드 속도 달성
- 설정 가이드 — llama-server 실행 시 필요한 파라미터 및 최적화 옵션 상세 제공
16GB AMD GPU에서 Qwen 3.8 27B Q4 XS 모델을 100k 컨텍스트, q8/q5 KV 캐시로 돌리고 있는데 디코드 속도 30 t/s(MTP 없음) 정도 나온다. 16GB VRAM으로는 Qwen 3.8 27B 돌리는 게 불가능하다고 생각하는 애들이 많길래 내 세팅 공유한다.
Vulkan으로 llama.cpp 빌드해라:
cmake -B build -DGGML_VULKAN=ON && cmake --build build --config Release -j
unsloth/Qwen3.8-27B-GGUF에서 Qwen3.8-27B-UD-IQ4_XS.gguf랑 mmproj-F16.gguf 받아온 다음, 이렇게 실행하면 된다:
llama-server \
--model Qwen3.8-27B-UD-IQ4_XS.gguf \
--mmproj mmproj-F16.gguf --no-mmproj-offload --image-max-tokens 2400 \
--n-gpu-layers 999 --ctx-size 100096 --parallel 1 --no-kv-unified \
--batch-size 2048 --ubatch-size 512 \
--flash-attn on --cache-type-k q8_0 --cache-type-v q5_1 \
--load-mode none --fit off \
--cache-ram 4096 --ctx-checkpoints 4 --checkpoint-min-step 8192 \
--no-context-shift --jinja --reasoning-format deepseek \
--temp 1.0 --top-p 0.95 --top-k 20 --min-p 0.0 \
--threads 6 --threads-batch 6 --host 127.0.0.1 --port 8080


