Qwen3.6 NVFP4 Unsloth 양자화 모델, 2.5배 더 빨라짐
2.5x faster Qwen3.6 NVFP4 Unsloth quants
핵심 요약
Unsloth가 Qwen3.6 모델을 위한 NVFP4 양자화 버전을 출시하여 성능을 최대 2.5배 향상했습니다.
- 성능 향상 — Qwen3.6 27B 모델에서 2.5배, 35B-A3B 모델에서 최대 1.79배 속도 개선함
- 기술적 차별점 — W4A4 양자화와 FP8 KV 캐시 보정을 통해 정확도 저하 없이 컨텍스트 길이 2배 확장함
- 모델 가용성 — 35B 모델의 Fast 버전과 일반 버전 등 다양한 옵션을 허깅페이스에 공개함
- 벤치마크 결과 — MMLU-Pro, GPQA 등 주요 지표에서 기존 NVIDIA NVFP4 대비 경쟁력 있는 성능 입증함
안녕하세요 r/LocalLLaMA 여러분! 저희가 Qwen3.6 27B 모델을 위한 NVFP4 양자화를 2.5배 더 빠르게, 그리고 35B-A3B 모델을 위한 양자화를 NVIDIA의 NVFP4 양자화 대비 정확도 저하 없이 1.56배에서 1.79배 더 빠르게 만들었습니다! 저희는 W4A4를 사용하여 행렬 곱셈에 실제 4비트 텐서 코어를 사용했고, NVIDIA는 W4A16을 사용합니다.
FP8 KV 캐시 보정도 제공되어 컨텍스트를 자동으로 2배 더 길게 사용할 수 있습니다. 정확도 측정을 위해 FP8, BF16, NVIDIA의 NVFP4, 그리고 저희의 NVFP4를 사용하여 MMLU-Pro, AIME 2025, GPQA 테스트를 진행했습니다. MTP도 미리 내장되어 있습니다.
또한 35B 버전의 NVFP4-Fast(1.79배 빠름)와 NVFP4(1.56배 빠름) 두 가지 버전을 제공합니다. NVFP4-Fast는 W4A4를 완전히 사용하고, 일반 NVFP4는 정확도를 조금 더 유지하기 위해 혼합 방식을 사용합니다.
NVFP4 링크:
Qwen3.6-35B-A3B-NVFP4 (1.56배 빠름)
Qwen3.6-35B-A3B-NVFP4-Fast (1.79배 빠름)
Qwen3.6-27B-NVFP4 (2.5배 빠름)
Qwen3.6-27B
| Provider | MMLU-Pro | GPQA | AIME 2025 |
| --- | --- | --- | --- |
| Unsloth | 86.25 | 86.34 | 93.12 |
| NVIDIA | 85.96 | 86.87 | 93.12 |
| FP8 | 86.11 | 86.87 | 93.75 |
| BF16 | 85.96 | 88.13 | 93.33 |
Qwen3.6-35B-A3B
| Provider | MMLU-Pro | GPQA | AIME 2025 |
| --- | --- | --- | --- |
| Unsloth | 85.85 | 86.74 | 92.29 |
| Unsloth Fast | 85.58 | 87.75 | 91.67 |
| NVIDIA | 85.60 | 87.12 | 91.88 |
| FP8 | 85.75 | 86.74 | 93.12 |
| BF16 | 85.75 | 86.36 | 92.50 |
NVFP4 Qwen3.6 블로그에서 더 많은 분석과 벤치마크를 확인하실 수 있습니다: https://unsloth.ai/docs/models/qwen3.6#nvfp4
다들 즐거운 주말 보내세요!


