Qwen3.6 27B와 llama.cpp 사용 후기
Qwen3.6 27B and llama.cpp appreciation post
핵심 요약
듀얼 RX 9070 XT 환경에서 Qwen3.6 27B의 뛰어난 성능과 에이전트 능력을 극찬함.
- Qwen3.6 27B 성능 — 실제 백엔드 디버깅 업무에서 뛰어난 추론 능력과 에이전트 기능을 보여줌.
- 듀얼 GPU 구성 — RX 9070 XT 2개를 사용해 32GB VRAM을 확보하고 MTP 양자화 모델을 구동함.
- 개인정보 보호 — 로컬 환경 구동으로 Gemini 등 외부 유출 걱정 없이 프라이빗한 작업이 가능함.
- llama.cpp 최적화 — MTP(Multi-Token Prediction)와 드래프트 모델을 통해 높은 토큰 생성 속도를 달성함.
우선, 제 설정은 다음과 같습니다:
llama-server
--host 0.0.0.0
--port 1235
--models-preset %h/Software/models.ini
--models-max 1
--sleep-idle-seconds 3600
--timeout 3600
--parallel 1
--device ROCm0,ROCm1
[*]
flash-attn = on
jinja = true
fit = true
ctxcp = 5
offline = true
mmproj-offload = false
mmap = false
; ... 여기에는 다른 모델들이 많이 있습니다 ...
[tp-go-brrr-WORK-CODE]
hf = unsloth/Qwen3.6-27B-MTP-GGUF:UD-Q5_K_XL
ctx-size = 131072
temp = 0.6
top-p = 0.95
top-k = 20
presence-penalty = 0.0
min-p = 0.00
fitt = 1024,1024,0
spec-type = draft-mtp
spec-draft-n-max = 2
chat-template-kwargs = {"preserve_thinking": true}
sm = tensor
최소한의 Pi 설정으로 정말 즐겁게 사용하고 있습니다.
저는 두 개의 RX 9070 XT(PCIe 5.0 x8/x8)를 사용 중이며, 둘 다 전력을 ~235W로 제한하고 실제 업무에 활용하고 있습니다. 양자화 수준이 제 취향보다는 조금 낮긴 하지만, 결과물의 속도, 지능, 그리고 지시 이행 능력은 현재 제 환경에서 제 사용 사례에 제공할 수 있는 최선이라고 느낍니다.
최근 서로 다른 설정을 가진 3개의 별도 인스턴스에 배포된 여러 백엔드 서비스 간의 상호작용을 분석하고, 그 과정에서 네트워킹 복잡성을 피해야 하는 긴 디버깅 세션을 진행했습니다.
5비트 양자화에서 약간의 거친 면이 보이긴 했지만, 모델은 제가 요청한 모든 것을 큰 문제 없이 수행했습니다. 상황을 충분히 제어할 수만 있다면, 이 모델의 에이전트 능력은 미쳤습니다. 로깅을 추가하고, 로컬에서 서비스를 실행하고, (로컬 및 원격 인스턴스 모두에) 요청을 보내고, 반복 작업을 수행하며, 재현성을 위해 실제로 중요한 코드는 건드리지 않도록 중요하지 않은 부분을 성공적으로 모킹(mocking)함으로써 모호한 문제들을 특정 코드 라인까지 성공적으로 찾아냈습니다. 이 모든 과정에서 밀집 모델(dense model)치고는 엄청난 반응성과 속도를 유지했습니다. 몇 가지 예시입니다:
prompt eval time = 845.93 ms / 337 tokens ( 2.51 ms per token, 398.38 tokens per second)
eval time = 5863.80 ms / 275 tokens ( 21.32 ms per token, 46.90 tokens per second)
total time = 6709.73 ms / 612 tokens
draft acceptance rate = 0.83981 ( 173 accepted / 206 generated)
prompt eval time = 1429.61 ms / 618 tokens ( 2.31 ms per token, 432.29 tokens per second)
eval time = 3862.16 ms / 175 tokens ( 22.07 ms per token, 45.31 tokens per second)
total time = 5291.77 ms / 793 tokens
draft acceptance rate = 0.80597 ( 108 accepted / 134 generated)

