MTP 벤치마크 결과: 생성 작업의 성격에 따라 추론 속도가 빨라질 수도(코딩), 느려질 수도(창의적 글쓰기) 있음. 다른 요인은 영향이 미미함.
MTP benchmark results: the nature of the generative task dictates whether you will benefit (coding) or get slower inference (creative) from speculative inference. No other factor comes close.
핵심 요약
MTP 추론은 코딩 작업에서 속도를 3배 높이지만, 창의적 글쓰기에서는 오히려 느려질 수 있어 작업 성격이 성능을 결정짓는 핵심 요소임.
- 작업 성격 — 코딩은 추론 속도가 대폭 향상되지만 창의적 글쓰기는 오히려 저하됨.
- 메모리 대역폭 — 모델이 추론 가속 효과를 얼마나 누릴 수 있는지 결정하는 핵심 요소임.
- 최적의 설정 — draft 토큰은 3개가 가장 적절하며, F16 모델은 4개가 더 효과적임.
- 성능 영향 — 온도나 양자화 방식보다 어떤 작업을 수행하느냐가 성능에 훨씬 큰 영향을 미침.
최근에 Qwen 3.6 27B의 MTP 퀀트 모델을 공개했는데, 레딧과 허깅페이스에서 추측적 추론(speculative inference)을 사용했을 때 오히려 속도가 더 느려졌다는 사용자들의 보고를 보고 놀랐습니다. 제가 보던 결과와는 달랐지만, 그들의 사용 방식을 그대로 재현해보니 그들이 겪은 현상이 확인되었습니다.
문제를 분석하기 위해 몇 가지 가설을 세웠으나 나중에 틀린 것으로 밝혀졌고, 본격적인 체계적 분석을 시작하여 300개 이상의 테스트와 벤치마크를 실행하고 다양한 매개변수를 변경하며 결과를 수집하고 비교했습니다. 제가 발견한 결과는 다음과 같습니다:
F16 + MTP는 코딩 작업 속도를 거의 3배로 높입니다. Q4_K_M + MTP는 창의적 글쓰기 속도를 늦춥니다. 같은 기능, 같은 모델, 같은 설정인데 결과는 정반대입니다.
모든 퀀트 사이즈를 테스트하지는 않았습니다. 그랬다면 며칠은 더 걸렸을 테니까요. 대신 5가지 중요한 사이즈로 제한했습니다. 변경한 다른 매개변수는 작업 유형(4가지), 온도(0.0, 0.3, 0.7), MTP 레이어의 양자화(q8 및 모델 퀀트와 일치)였습니다. 온도와 MTP 퀀트는 결과에 거의 영향을 미치지 않았습니다.
MTP를 사용하지 않은 베이스라인과 비교한 MTP 누적 평균 디코드 속도(모델 퀀트 및 작업 유형별):
|quant|base tok/s|code|factual|analysis|creative|
|:-|:-|:-|:-|:-|:-|
|Q4_K_M|15.1|19.7|17.5|14.9|13.7|
|Q5_K_M|13.1|19.2|16.5|14.7|12.6|
|Q6_K|13.4|20.1|17.6|15.2|13.4|
|Q8_0|11.4|25.4|21.7|18.6|16.9|
|F16|6.6|17.9|14.9|12.6|11.0|
메모리 대역폭이 모델이 추측적 디코딩으로부터 얼마나 혜택을 받을 수 있는지를 결정합니다. 51GB의 F16은 6.6 tok/s로 기어갑니다. 모든 토큰이 전체 모델을 메모리에서 끌어와야 하기 때문입니다. 승인된 MTP draft는 그 과정을 건너뜁니다. 16GB의 Q4_K_M은 이미 충분히 빨라서 코딩처럼 예측 가능한 작업이 아니면 draft 오버헤드가 거의 가치가 없습니다.
draft 토큰 수용률을 결정하는 요소:
|task|acceptance|examples|
|:-|:-|:-|
|code|79-89%|writing functions, debugging, refactoring|
|factual|62-70%|definitions, translation, math proofs|
|analysis|48-56%|tradeoff breakdowns, technical comparisons|
|creative|39-48%|stories, poetry, brainstorming, roleplay|
코딩에서 창의적 글쓰기까지 40포인트 차이가 납니다. 세 가지 온도와 다섯 가지 퀀트를 시도했지만 수치는 거의 변하지 않았습니다. 코딩 작업에서는 draft 토큰 4/5가 정확하지만, 창의적 작업에서는 1/2도 안 됩니다. 무엇을 생성하느냐만큼 중요한 것은 없습니다.
또한 모든 시나리오에서 이 모델에 대한 최적의 draft 토큰 수도 테스트했습니다. 3이 draft 토큰의 스위트 스팟입니다. 더 높이면 수용률이 추가 draft가 보상하는 것보다 더 빨리 떨어집니다. F16은 예외입니다: N=4가 N=3보다 낫습니다(17.9 대 16.2). 6.6 tok/s에서는 살아남은 모든 draft 토큰이 낮은 적중률을 상쇄할 가치가 있기 때문입니다.
|use case|Q4_K_M|Q5_K_M|Q6_K|Q8_0|F16|
|:-|:-|:-|:-|:-|:-|
|coding|🟢 +31%|🟢 +47%|🟢 +50%|🟢 +123%|🟢 +171%|
|factual QA|🟡 +16%|🟢 +26%|🟢 +31%|🟢 +90%|🟢 +125%|
|analysis|🔴 -1%|🟡 +12%|🟡 +13%|🟢 +64%|🟢 +91%|
|creative|🔴 -9%|🔴 -4%|🔴 -1%|🟢 +48%|🟢 +67%|


