nvidia/Gemma-4-26B-A4B-NVFP4 모델
nvidia/Gemma-4-26B-A4B-NVFP4
핵심 요약
NVFP4 양자화가 적용된 Gemma-4-26B 모델의 성능과 하드웨어 호환성 및 최적화에 대한 논의.
- 성능 지표 — NVFP4 양자화가 적용되었음에도 원본 모델과 대등하거나 일부 지표에서 더 나은 성능을 보여줌.
- MoE 아키텍처 — 양자화로 인한 가중치 노이즈가 전문가 라우팅을 정규화하여 성능 향상에 기여함.
- 하드웨어 호환성 — 소비자용 GPU와 데이터센터용 GPU 간의 NVFP4 지원 차이 및 vLLM 설정 최적화 논의.
- 컨텍스트 최적화 — NVFP4 KV 캐시를 활용하여 5090 환경에서 더 긴 컨텍스트를 확보하는 방법 공유.
5090에서 80% 할당(32GB 중)으로 50k 컨텍스트 정도 나오는 거 확인했음.
18.8GB임
| Benchmark | Baseline (Full Precision) | NVFP4 |
| --- | --- | --- |
| GPQA Diamond | 80.30% | 79.90% |
| AIME 2025 | 88.95% | 90.00% |
| MMLU Pro | 85.00% | 84.80% |
| LiveCodeBench (pass@1) | 80.50% | 79.80% |
| IFBench | 77.77% | 78.1% |
| IFEval | 96.60% | 96.40% |

