다들 한번 봐줘, 이 Qwen3.6 27B 양자화 레시피는 일관되게 덜 생각하면서도 정답을 맞히네
Need a second pair of eyes, this Qwen3.6 27B quant recipe consistently thinks less and is correct
핵심 요약
Qwen3.6 27B 모델의 특정 양자화 레시피가 추론 토큰을 획기적으로 줄이면서도 정확도를 유지한다는 분석 결과임.
- 양자화 레시피 — 특정 레이어를 BF16으로 유지하는 방식으로 추론 토큰을 40~60% 절감함.
- 추론 효율성 — 모델이 더 적게 생각하면서도 수학 문제 등에서 동일하거나 더 나은 성능을 보임.
- 성능 비교 — 기존 UD Q8 K XL 대비 더 적은 토큰으로 빠르게 답변을 생성함.
- 재현 방법 — HF safetensors를 GGUF로 변환 후 특정 레이어를 BF16으로 유지하며 양자화함.
자, 내 말 좀 들어봐.
이 모든 건 왜 이 Qwen3.6 27B INT8 Autoround 레시피(https://huggingface.co/Minachist/Qwen3.6-27B-INT8-AutoRound/tree/main)가 내가 시도해 본 다른 Qwen3.6 27B 양자화보다 훨씬 성능이 좋은지 이해하려고 하면서 시작됐어. 개인적인 Rust + Bevy 벤치마크에서 이 모델은 일관되게 더 나은 코드와 게임을 출력했거든. 그러다 모델이 '생각'을 훨씬 덜 한다는 걸 알아챘어. INT8 모델은 훌륭하지만 vLLM VRAM 사용량이 더 높더라고. 마침 llama-cpp(PR 단계)에 MTP가 들어갔길래, 이걸 양자화해서 MTP도 추가해 보기로 했지.
흥미로운 점은 INT8 autoround와 내가 만든 GGUF 양자화 모델 모두 답변에 더 빨리 도달한다는 측면에서 UD Q8 K XL보다 성능이 좋아 보인다는 거야. Minachist가 했던 것처럼 BF16 레이어를 그대로 유지했어. 공식 테스트를 위해 AIME 수학 문제와 Opus 4.7이 만들어준 커스텀 수학 문제를 사용했지. 새로운 양자화 모델은 크기가 UD Q8 K XL보다 아주 약간 더 큰 정도인데, 성능 차이는 놀라울 정도로 눈에 띄어.
이 테스트들을 BF16에서 똑같이 돌려보면 이런 동작이 실제로 선호되는 방식인지 알 수 있을 것 같아. 어쩌면 더 많이 생각하는 게 사실 더 좋을 수도 있지만, 내 경험상으로는 정반대였어. 어쨌든 결과는 다음과 같아.
내가 테스트한 양자화 모델들은 다음과 같아(MTP 레이어가 포함되어 있어 약간 더 큼):
- Q8_0 28595762432
- 디스크 크기: 29047084160 (28.3 GiB)
- Q8 K XL
- 디스크 크기: 35776484480 (34.9 GiB)
- INT8 autoround 레시피를 레이어별로 복사하려고 시도한 이 양자화 모델
- 디스크 크기: 37144875200 bytes (36.2 GiB)
그럼 더 큰 모델이 더 나은 성능을 보인 게 놀라운가? 아니. 하지만 아주 흥미로운 점은 생각하는 양이 급격히 줄었다는 거야. 즉, 더 큰 양자화 모델을 돌리느라 잃어버린 KV 캐시 공간을 생각하는 데 드는 토큰을 20% 줄임으로써 되찾은 셈이지.
내가 돌린 결과는 다음과 같아:
모두 동일한 시드와 샘플링 파라미터를 사용했어. 여러 번(3회) 실행해도 동일한 결과가 나왔어. KV 캐시는 bf16/bf16으로 설정.
--temp 0.6 --top-p 0.95 --top-k 20 --min-p 0.0 --presence-penalty 0.0 --repeat-penalty 1.0 --seed 1337
질문 1 (수학, AIME 스타일)
(x^3-7x^2+14x-8=0)의 근이 (a,b,c)일 때, (\frac1{a^2+1}+\frac1{b^2+1}+\frac1{c^2+1}=\frac mn)을 기약분수로 나타내면 (m+n)은 얼마인가?
Llama CPP
- Q8
- 3분 48초 동안 16,234 토큰, 70.90 t/s (MTP 2토큰 적용)
- UD Q8 K XL
- 4분 00초 동안 16,001 토큰, 66.24 t/s
- Custom Q8
- 2분 39초 동안 9,671 토큰, 60.60 t/s ~40% 덜 생각함
vLLM


