llama.cpp에서 Qwen 3.6 27B 플래그/설정 공유
Qwen 3.6 27B flags/settings in llama.cpp
핵심 요약
RTX 5090 환경에서 Qwen 3.6 27B 모델을 구동하는 최적의 llama.cpp 설정과 추론 예산에 대한 사용자들의 공유 및 논의.
- 하드웨어 최적화 — RTX 5090의 VRAM 한계 내에서 262k 컨텍스트를 구동하기 위한 세밀한 설정 공유함.
- 추론 예산 설정 — 16k 수준의 추론 예산이 복잡한 프로그래밍 작업에서 성능 향상에 효과적임을 확인함.
- 배치 사이즈 논쟁 — 성능 향상을 위해 배치 사이즈를 1024~2048로 높여야 한다는 의견과 현재 설정이 적절하다는 의견이 대립함.
- 성능 튜닝 팁 — MTP 및 N-gram 모드 활용, 캐시 양자화 등을 통해 추론 속도를 개선하는 방법이 제시됨.
RTX 5090에서 다음 설정을 사용 중인데 성능은 괜찮습니다. 대부분 80-100 t/s 정도 나오지만, 262k 컨텍스트를 꽉 채우면 가끔 40 t/s 정도로 느려지기도 합니다. 주로 앱 개발 작업에 사용하고 있습니다. 비전 기능 없이 5090에 간신히 들어가며, 여유 공간은 거의 없습니다.
배치 사이즈(-b / -ub)는 처음에 훨씬 다른 값으로 설정했었지만, 코딩 테스트를 반복하며 최상의 성능과 결과물을 내는 값으로 정착했습니다. 다른 사람들은 이 값을 훨씬 높게 설정하는 걸 봤는데, 여기서는 별 도움이 안 되는 것 같더군요.
추론 예산(Reasoning budget)도 다른 사람들이 사용하는 것보다 꽤 높게 잡았는데, 괜찮은 것 같습니다. 평가 지표로 정량화하기는 어렵지만, 이 값을 낮추면 모델이 더 자주 길을 잃는 것 같더군요.
솔직히 모든 설정을 깊게 파고들지는 않았습니다. 토큰이 미친 듯이 잘 나오고 있어서 꽤 만족하거든요. 하지만 궁금한 게 있습니다. 여러분은 이 설정들을 다르게 하시나요? 만약 그렇다면 왜, 대체 무슨 짓을 하고 계신 건가요? 토큰 말고 정보를 좀 풀어주세요. Fuck spez.
llama-server \
-m '/ai/models--unsloth--Qwen3.6-27B-MTP-GGUF/snapshots/5cb35eb3dcbf52dbce5f87dbc64df6aaffadcace/Qwen3.6-27B-Q6_K.gguf' \
-c 262144 \
-b 512 \
-ub 128 \
--gpu-layers all \
--spec-draft-ngl all \
--fit off \
--parallel 1 \
--flash-attn on \
--no-context-shift \
--cache-type-k q8_0 \
--cache-type-v q8_0 \
--spec-type draft-mtp \
--spec-draft-n-max 3 \
--spec-draft-p-min 0.2 \
--cache-ram 16384 \
--ctx-checkpoints 32 \
--checkpoint-min-step 8192 \
--jinja \
--reasoning on \
--reasoning-budget 16384 \
--no-reasoning-preserve \
--load-mode none \
--no-mmproj \
--alias 'unsloth/Qwen3.6-27B-MTP-GGUF' \
--metrics \
--perf \
--host 0.0.0.0 \
--port 1234


