nvidia/Qwen3.6-35B-A3B-NVFP4 · 허깅페이스
nvidia/Qwen3.6-35B-A3B-NVFP4 · Hugging Face
핵심 요약
엔비디아가 Qwen3.6-35B-A3B 모델을 NVFP4로 양자화하여 vLLM 추론 효율을 높인 버전을 공개했습니다.
- NVFP4 양자화 — 모델 가중치를 4비트로 최적화하여 메모리 요구량을 약 3배 감소시킴
- vLLM 지원 — vLLM 환경에서 즉시 추론 가능하도록 설계됨
- 성능 유지 — BF16 대비 높은 정확도 벤치마크 결과를 유지함
- 최적화 범위 — MoE 구조 내 트랜스포머 블록의 선형 연산자 가중치와 활성화 함수를 양자화함
huggingface.co
원문 사이트로 이동
NVIDIA Qwen3.6-35B-A3B-NVFP4 모델은 알리바바의 Qwen3.6-35B-A3B 모델을 양자화한 버전으로, 최적화된 트랜스포머 아키텍처를 사용하는 자기회귀 언어 모델입니다. 자세한 정보는 여기에서 확인하세요. NVIDIA Qwen3.6-35B-A3B-NVFP4 모델은 Model Optimizer를 사용하여 양자화되었습니다.
Post Training Quantization
이 모델은 Qwen3.6-35B-A3B의 가중치를 NVFP4 데이터 타입으로 양자화하여 vLLM을 통한 추론 준비를 마쳤습니다. MoE 내 트랜스포머 블록의 선형 연산자 가중치와 활성화 값만 양자화되었습니다. 이러한 최적화를 통해 파라미터당 비트 수를 16에서 4로 줄여 디스크 크기와 GPU 메모리 요구량을 약 3.06배 감소시켰습니다.
Evaluation
정확도 벤치마크 결과는 아래 표와 같습니다:
| Precision | MMLU Pro | GPQA Diamond | τ²-Bench Telecom | SciCode | AIME 2025 | AA-LCR | IFBench | MMMU PRO |
| :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- | :--- |
| BF16 | 85.6 | 84.9 | 95.5 | 40.8 | 89.2 | 62.0 | 62.3 | 74.1 |
| NVFP4 | 85.0 | 84.8 | 94.7 | 40.6 | 88.8 | 62.0 | 62.8 | 74.5 |

