Qwen3.6 35B A3B 모델과 ik_llama.cpp를 사용하여 12GB VRAM에서 110 tok/s 달성
110 tok/s with 12GB VRAM on Qwen3.6 35B A3B and ik_llama.cpp
핵심 요약
12GB VRAM 환경에서 ik_llama.cpp를 활용해 Qwen3.6 35B 모델의 추론 속도를 23% 향상시킨 사례.
- 성능 최적화 — ik_llama.cpp를 사용하여 기존 llama.cpp 대비 23% 향상된 초당 110 토큰 속도를 기록함.
- 하드웨어 활용 — CachyOS와 iGPU 활용 설정을 통해 12GB VRAM을 최대로 사용하여 메모리 부족 문제를 해결함.
- MTP 벤치마크 — Qwen3.6 35B A3B 모델을 대상으로 다양한 작업 환경에서 추론 속도와 정확도를 비교함.
- 설정 팁 — OOM 오류 방지를 위해 fit-margin 값을 조정하는 등 최적화된 실행 파라미터를 공유함.
RTX 4070 Super 12GB에서 llama.cpp로 훌륭한 MTP 성능을 경험하고 있었는데, MTP PR이 병합된 후 성능이 급락했습니다. 그래서 MTP를 지원하고 CPU 오프로딩에 더 최적화된 ik_llama.cpp를 시도해 봤는데, 예상보다 훨씬 큰 속도 향상을 경험했습니다!
벤치마크 결과를 보기 전에, 제 PC 사양은 다음과 같습니다:
OS: CachyOS (강력 추천)
GPU: RTX 4070 Super 12GB
CPU: AMD Ryzen 7 9700X
RAM: 48GB DDR5-6000 EXPO I
업데이트: 비교를 위해, 최근 byteshape에서 출시한 Qwen3.6-35B-A3B-IQ4_XS-4.19bpw 양자화 모델을 사용한 일반 llama.cpp의 mtp-bench.py 결과를 공유합니다. 이 모델은 Unsloth의 Q4_K_XL과 정확도는 비슷하지만 크기는 4GB 더 작습니다:
❯ ./mtp-bench.py
code_python pred= 192 draft= 122 acc= 118 rate=0.967 tok/s=79.8
code_cpp pred= 192 draft= 117 acc= 110 rate=0.940 tok/s=89.1
explain_concept pred= 192 draft= 124 acc= 113 rate=0.911 tok/s=88.0
summarize pred= 192 draft= 139 acc= 127 rate=0.914 tok/s=95.0
qa_factual pred= 192 draft= 133 acc= 128 rate=0.962 tok/s=97.0
translation pred= 192 draft= 125 acc= 117 rate=0.936 tok/s=91.6
creative_short pred= 192 draft= 109 acc= 99 rate=0.908 tok/s=82.1
stepwise_math pred= 192 draft= 130 acc= 125 rate=0.962 tok/s=97.0
long_code_review pred= 192 draft= 121 acc= 115 rate=0.950 tok/s=88.2
Aggregate: {
"n_requests": 9,
"total_predicted": 1728,
"total_draft": 1120,
"total_draft_accepted": 1052,
"aggregate_accept_rate": 0.9393,
"wall_s_total": 21.86
}
평균 89.76 tok/s가 나옵니다.

