Qwen 3.6 35B GGUF: GPU 및 CPU 환경별 NTP vs MTP 양자화 성능 비교
Qwen 3.6 35B GGUF: NTP vs MTP quantization results across GPUs and CPUs
핵심 요약
Qwen 3.6 35B 모델의 NTP와 MTP 양자화 방식을 다양한 하드웨어에서 벤치마크하여 최적의 선택 가이드를 제시함.
- 양자화 방식 비교 — NTP와 MTP 방식을 다양한 GPU 및 CPU 환경에서 벤치마크함.
- NTP 성능 우위 — 메모리 한도 내에서 가장 큰 모델을 선택하는 것이 품질과 속도 면에서 효율적임.
- MTP 속도 향상 — GPU 환경에서는 20~40% 속도 향상이 있으나 CPU에서는 오히려 성능 저하가 발생함.
- 하드웨어 의존성 — MTP는 워크로드와 하드웨어 사양에 따라 성능 차이가 크므로 테스트가 필수적임.
안녕하세요 r/LocalLLaMA 여러분,
저희가 ByteShape Qwen 3.6 35B GGUF 양자화 모델을 두 가지 계열로 출시했습니다: 표준 NTP(Next Token Prediction, 비 MTP)와 MTP입니다.
블로그 / NTP 모델 다운로드 / MTP 모델 다운로드
요약
- NTP의 경우, "메모리에 맞는 가장 큰 양자화 모델을 선택하는 것"이 놀라울 정도로 효과적이었습니다.
- 낮은 bpw가 무조건 좋은 것은 아니었습니다. 저희의 가장 큰 모델은 프롬프트 처리와 토큰 생성 속도를 포함한 품질/속도 면에서 압도적이었습니다.
- MTP는 GPU에서 보통 20~40% 정도의 실질적인 생성 속도 향상을 가져왔지만, 추가적인 메모리 점유율로 인해 모델 선택 기준이 달라질 수 있습니다.
- MTP의 속도 향상은 워크로드에 따라 크게 달라집니다.
- 테스트 결과 CPU에서 MTP는 매력적이지 않았기에, CPU용으로는 NTP를 권장합니다.
- Qwen 3.6이 전체 정밀도에서 답변 형식 준수 문제가 있어 벤치마크 결과가 왜곡될 수 있다고 판단, 이번 릴리스에서는 MMLU를 제외했습니다.
이번 릴리스에서는 단순히 모델만 배포하는 것이 아니라 소규모 하드웨어 연구를 병행하고자 했습니다. RTX 4090, 5090, Pro 6000, 4080, 5060 Ti와 Intel i7, Intel Ultra 7, Ryzen 9, Raspberry Pi 5 등 다양한 환경에서 원본 모델과 여러 양자화 버전을 벤치마크했습니다. 비교에 도움을 준 Bartowski, Unsloth, Mudler, AesSedai 등 양자화 전문가들에게 감사를 표합니다. 모든 양자화 모델을 평가하기엔 무리가 있어, 가장 추천되는 모델 위주로 선정했습니다 (3.7 버전이 나오면 또 다를 수 있겠죠!).
주요 NTP 결과는 다소 직관적이지 않았습니다. 보통은 bpw가 낮은 양자화 모델이 속도 면에서 확실히 우세할 것이라 예상하지만, 이번에는 가장 큰 모델이 품질뿐만 아니라 프롬프트 처리와 토큰 생성 속도에서도 경쟁력을 유지했습니다. 따라서 bpw를 무조건 낮추려 하지 마세요. 메모리와 컨텍스트 예산 내에서 더 큰 모델을 쓸 수 있다면, 그것이 더 나은 선택일 수 있습니다.
16GB 기기나 Raspberry Pi 5와 같은 하드웨어별 예외 사항이 있으므로, 자세한 추천 사항과 그래프는 블로그를 참고해 주시기 바랍니다.
MTP의 경우 트레이드오프가 다릅니다. GPU에서는 보통 20~40%의 의미 있는 생성 속도 향상을 보였지만(워크로드에 따라 크게 다름), MTP는 런타임 메모리 사용량을 늘리기 때문에 16GB GPU에서는 더 큰 MTP 모델을 사용하기 어려워 GPU-2 MTP 모델을 권장하게 되었습니다. MTP 결과 역시 bpw 관찰 결과와 일치하는데, 경우에 따라 더 큰 모델이 처리량 면에서 더 작은 모델을 거의 따라잡기도 합니다.

