llama.cpp의 초기 SM120 네이티브 NVFP4 MMQ 병합 완료
llama.cpp's Preliminary SM120 Native NVFP4 MMQ Is Merged
핵심 요약
llama.cpp에 SM120 아키텍처용 NVFP4 네이티브 지원이 추가되어 50시리즈 GPU 등에서 추론 성능이 대폭 향상됨.
- NVFP4 지원 — Blackwell 텐서 코어의 FP4 연산을 직접 활용하여 추론 속도와 효율을 극대화함.
- 성능 향상 — 50시리즈 GPU 사용 시 프리필(prefill) 속도가 비약적으로 빨라짐.
- GGUF 호환성 — NVFP4 전용 GGUF 모델들이 이미 배포되어 즉시 사용 가능함.
- 하드웨어 범위 — RTX 50시리즈뿐만 아니라 RTX 6000 등 다양한 SM120 기반 하드웨어에서 작동함.
