Qwen3.6-35B-A3B 툴 호출 벤치마크: ByteShape vs Unsloth GGUF, KV 캐시 양자화 및 긴 컨텍스트 성능 비교
Qwen3.6-35B-A3B tool calling benchmark: ByteShape vs. Unsloth GGUFs, KV cache quants & long context performance
핵심 요약
Qwen3.6-35B-A3B 모델의 툴 호출 성능을 ByteShape와 Unsloth 양자화 방식별로 비교 분석한 결과입니다.
- 벤치마크 결과 — ByteShape와 Unsloth 간의 뚜렷한 승자는 없으며 모델 크기와 성능 간의 상관관계가 낮음
- KV 캐시 양자화 — q8_0은 성능 저하 없는 '공짜 점심' 수준이나 q4_0은 성능이 다소 하락함
- 컨텍스트 압박 — 긴 컨텍스트 환경에서 모든 모델의 툴 호출 성능이 크게 저하됨
- 데이터 노이즈 — 벤치마크 측정값이 불안정하여 개별 수치보다는 전체적인 경향성 위주로 해석 필요
이전에 성능 벤치마크를 몇 번 올린 적은 있는데, 이번에는 정성적인 측면에 관심이 생겼어. 며칠 전에 u/Substantial_Step_351이 왜 모델들이 툴 콜링(tool calling)으로 벤치마크되지 않는가에 대한 글을 올렸고, 댓글에서 u/complexminded가 SeraphimSerapis의 tool-eval-bench 유틸리티를 언급하더라고. 그래서 평소에 궁금했지만 제대로 된 답을 찾지 못했던 몇 가지 질문들을 직접 벤치마크해보기로 했지.
- Qwen3.6-35B-A3B의 ByteShape 퀀트가 블로그 포스트에서 주장하는 만큼 진짜 좋은가? 벤치마크를 보면 ~4bpw 퀀트가 비양자화 모델 대비 99% 이상의 점수를 유지하면서, Unsloth, AesSedai, bartowski 같은 다른 퀀트들과 비슷하거나 더 나은 성능을 보여주는데 속도는 더 빠르고 용량은 보통 더 작다고 하거든.
- KV 캐시 양자화가 실제 성능에 어떤 영향을 미칠까? q8_0은 공짜 점심(성능 저하 없는 이득)일까? q4_0은 얼마나 구릴까?
- 짧은 프롬프트가 아니라 긴 컨텍스트 설정에서 보면 결과가 달라질까?
TL;DR: ByteShape랑 Unsloth 중에 확실한 승자는 없음. q8_0은 공짜 점심 맞음. 근데 q4_0은 확실히 성능 떨어짐. 긴 컨텍스트는 모든 시나리오에서 툴 콜링 성능을 꽤 많이 깎아먹음.
준비물
V100 GPU 32GB VRAM짜리 클러스터가 잠시 비어서, llama.cpp랑 tool-eval-bench를 써서 실험을 좀 돌려봤어. 먼저 비교할 Qwen3.6-35B-A3B 퀀트들을 IQ랑 Q 타입 섞어서 골랐지.
- ByteShape IQ3_S-3.48bpw (일명 GPU-3, 15.1 GB): ByteShape가 16GB VRAM용으로 추천하는 거 (간신히 들어감)
- ByteShape IQ4_XS-4.15bpw (일명 GPU-5, 18.0 GB): ByteShape가 24GB VRAM용으로 추천하는 거
- ByteShape Q4_K_S-4.22bpw (일명 CPU-5, 18.3 GB): 내가 6GB VRAM 노트북에서 CPU 섞어서 쓰는 거
- Unsloth UD-IQ3_XXS (13.2 GB): 16GB VRAM에 들어가는 아주 컴팩트한 IQ 퀀트, 가끔 체급 이상의 성능을 보여줌
- Unsloth UD-Q3_K_XL (16.8 GB): ByteShape CPU-5랑 비슷한 크기의 Q 퀀트
- Unsloth UD-IQ4_XS (17.7 GB): ByteShape GPU-5랑 비슷한 크기의 IQ 퀀트


