현재 가장 빠른 Qwen3.8 27B NVFP4 양자화 모델
Fastest NVFP4 quant of Qwen3.8 27B out there
핵심 요약
RTX 5090 환경에서 기존 대비 50% 빠른 속도를 제공하는 Qwen3.8 27B NVFP4 양자화 모델이 공개되었습니다.
- 성능 향상 — 기존 Q4 양자화 대비 50% 빠른 속도 구현
- 하드웨어 최적화 — RTX 5090 환경에서 6250 t/s의 벤치마크 기록
- 기능 포함 — MTP(Multi-Token Prediction) 드래프트 헤드 탑재
- 호환성 — 별도의 브랜치 없이 최신 llama.cpp에서 구동 가능
huggingface.co
원문 사이트로 이동
이번에 새로 나온 Blackwell 네이티브, prefill 최적화 4비트 양자화 모델인데, 같은 메모리 용량의 Q4 양자화 모델보다 호환 하드웨어에서 50% 더 빠르게 돌아감.
RTX 5090 32GB에서 벤치마크 돌려보니까 다른 NVFP4 양자화 모델보다 4-7% 더 빠르더라.
| Quant | Benchmark | Speed |
|---|---|---|
| NVFP4 | pp2048 | 6250 t/s |
| unsloth NVFP4 | pp2048 | 6010 t/s |
| Q4_0 | pp2048 | 4130 t/s |
| Q6_K | pp2048 | 3210 t/s |
이 GGUF 파일에는 덤으로 양자화된 MTP draft head도 포함되어 있음.
여기서 자세한 내용 확인하고, 특히 15% 더 빠른 MTP를 위한 권장 설정도 꼭 챙겨 봐라.

