2x 4060ti에서 Qwen3.6 q4xl 125 tok/s라니 가성비 미쳤네
125 tok/s for Qwen3.6 q4xl on 2x 4060ti is insane perf/dollar
핵심 요약
2x 4060ti 환경에서 Qwen3.6 모델을 구동해 125 tok/s라는 압도적인 가성비를 달성한 사례 공유.
- 가성비 성능 — 1,000달러 미만으로 32GB VRAM 환경 구축
- 벤치마크 공유 — llama.cpp 설정 및 모델 구성 정보 공개
- 기술적 논쟁 — NVFP4 지원 문제와 V100 대비 효율성 토론
- 품질 이슈 — Q4 양자화의 품질 저하와 Q6 사용 권장 의견
2023년형 32GB VRAM을 1,000달러 미만에, 소비 전력은 약 300와트... 게다가 이 녀석이 2026년형 5,000달러짜리 미니 PC들보다 성능이 더 잘 나옴.
그래서... 다음 질문은 이번 주말에 CUDA 13.3에서 같은 q4xl로 150 t/s까지 쥐어짤 수 있느냐는 거임. 해본 사람 있음?
Edit llamacpp ini/flags:
podman run -d \
--name llama-qwen36-router \
--device nvidia.com/gpu=all \
-v /data/models:/root/.cache/huggingface:ro \
-v /data/llama_presets:/presets:ro \
-p 8001:8080 \
--env NVIDIA_VISIBLE_DEVICES=all \
--env LD_LIBRARY_PATH=/app:/usr/lib64:/usr/local/nvidia/lib64:/usr/local/cuda/lib64 \
--ipc=host \
--restart=unless-stopped \
ghcr.io/ggml-org/llama.cpp:server-cuda13 \
--models-preset /presets/qwen36-models.ini \
--models-max 1 \
--host 0.0.0.0 \
--port 8080
그리고 벤치마크에 사용된 qwen36-models.ini - 친구들이 쓰기 편하게 27b는 100k로 낮췄음:
version = 1
[*]
n-gpu-layers = all
host = 0.0.0.0
port = 8080
ctx-checkpoints = -1
mmap = false
flash-attn = on
; threads = 16
; threads-batch = 20
cache-ram = 2048
parallel = 1
batch-size = 2048
ubatch-size = 1024
jinja = true
reasoning = on
reasoning-budget = 1000
metrics = true
load-on-startup = false
[qwen36-27b-mtp-tensor]
hf-repo = unsloth/Qwen3.6-27B-MTP-GGUF
hf-file = Qwen3.6-27B-UD-Q4_K_XL.gguf
split-mode = tensor
tensor-split = 0.95,0.95
ctx-size = 100000
spec-type = draft-mtp
spec-draft-n-max = 2
[qwen36-35b-a3b-mtp-q4xl-mtpOn-Tensor]
hf-repo = unsloth/Qwen3.6-35B-A3B-MTP-GGUF
hf-file = Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf
split-mode = tensor
tensor-split = 0.97,0.97
ctx-size = 125000
spec-type = draft-mtp
spec-draft-n-max = 2

