QUASAR QAD를 적용한 완전 양자화 NVFP4 Qwen3.8-27B 모델 공개
Fully quantized NVFP4 Qwen3.8-27B with QUASAR QAD
핵심 요약
QUASAR QAT 알고리즘을 사용해 성능 손실을 최소화한 NVFP4 Qwen3.8-27B 모델이 공개됨.
- QUASAR 알고리즘 — QAT를 통해 NVFP4에서도 BF16에 근접한 성능 유지함.
- 모델 효율성 — 27B 모델을 19.7GB로 압축하여 메모리 사용량 대폭 절감함.
- 하드웨어 요구사항 — NVIDIA Blackwell GPU 환경에서 vLLM을 통해 구동 가능함.
- 성능 비교 — 기존 NVFP4 체크포인트 대비 GPQA 등 벤치마크에서 우수한 결과 기록함.
huggingface.co
원문 사이트로 이동
Qwen3.8-27B의 완전 양자화 버전인 NVFP4 모델을 공개한다. 이 체크포인트는 우리가 새로 개발한 QAT 알고리즘인 QUASAR를 활용한 양자화 인식 증류(QAD) 방식으로 학습했어. 원본 BF16 모델을 티처 모델로 삼아서 양자화된 모델을 2,446 스텝 동안 증류시켰다.
이 체크포인트는 NVIDIA Blackwell GPU에서 vLLM을 지원해:
vllm serve QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4 \
--max-model-len 262144 \
--gpu-memory-utilization 0.85
이 모델은 아주 공격적인 양자화 설정을 사용했어. 모든 트랜스포머 블록의 선형 레이어 전체를 NVFP4(W4A4)로 양자화했거든.
보통 어텐션이나 GDN 레이어는 양자화하면 모델 성능이 확 떨어지니까 FP8이나 BF16 같은 고정밀도를 유지하는 게 국룰인데, QUASAR를 쓰니까 완전 양자화된 체크포인트인데도 BF16이랑 거의 차이 없는 성능이 나오더라. 다른 NVFP4 체크포인트들이랑 비교한 평가 결과는 아래와 같아.
| Model | Size | GPQA-Diamond (2 runs, n=396) | AIME26 (3 repeats, n=90) |
|---|---|---|---|
Qwen/Qwen3.8-27B (original BF16) | 55.6 GB | 0.9141 | 1.0000 |
QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4 | 19.7 GB | 0.9091 | 1.0000 |
unsloth/Qwen3.8-27B-NVFP4 | 23.4 GB | 0.8939 | 0.9778 |
Inferact/Qwen3.8-27B-NVFP4 | 26.4 GB | 0.8763 | 0.9667 |
논문: https://arxiv.org/abs/2608.13966v1
이 체크포인트 써보고 피드백 좀 많이 남겨줘!


