llama.cpp - Blackwell 아키텍처 NVFP4 네이티브 지원 시작 - b8967
llama.cpp - NVFP4 native support on Blackwell from now - b8967
핵심 요약
llama.cpp가 NVIDIA Blackwell GPU의 NVFP4를 공식 지원하며 RTX 5090 등에서 성능과 전력 효율이 대폭 개선되었습니다.
- Blackwell NVFP4 지원 — llama.cpp 최신 빌드에서 NVIDIA Blackwell GPU 전용 NVFP4 형식을 네이티브로 지원함.
- 전력 효율 극대화 — RTX 5090 벤치마크 결과 전력 소모가 600W에서 300W로 절반가량 감소하며 효율이 좋아짐.
- 프롬프트 처리 최적화 — 이번 업데이트는 토큰 생성(TG)보다는 프롬프트 처리(PP) 속도 향상에 중점을 둔 것으로 분석됨.
- 실성능 향상 체감 — 사용자들은 이전 대비 초당 약 5토큰 이상의 속도 향상을 경험하고 있으며 관련 GGUF 모델 공유가 활발함.
It looks like finally we have it! Time to test!!!
https://github.com/ggml-org/llama.cpp/releases/tag/b8967
Platform: RTX 5090+(RTX5060TI - but not used during test) - Ryzen 9 9950X3D+128 GB DDR5 5600 CL36):
TEST:
CUDA_VISIBLE_DEVICES=0 /home/marcin/llama.cpp/llama-bench \
-m /home/marcin/llama.cpp_models/Qwen3.6-27B-NVFP4/Qwen3.6-27B-NVFP4.gguf \
-ngl 999 \
-fa 1 \
-p 512,2048 \
-n 128,512 \
-d 0,4096,8192,16384,32768 \
-r 5 \
-o md | tee /home/marcin/qwen3.6-27b-nvfp4-gpu0-bench-depth.md
| model | size | params | backend | ngl | fa | test | t/s |
|---|---|---|---|---|---|---|---|
| qwen35 27B NVFP4 | 17.50 GiB | 26.90 B | CUDA | 999 | 1 | pp512 | 5546.93 ± 220.29 |
| qwen35 27B NVFP4 | 17.50 GiB | 26.90 B | CUDA | 999 | 1 | pp2048 | 5594.58 ± 7.70 |
| qwen35 27B NVFP4 | 17.50 GiB | 26.90 B | CUDA | 999 | 1 | tg128 | 73.62 ± 0.16 |
| qwen35 27B NVFP4 | 17.50 GiB | 26.90 B |


