ggml-hip: HIP 빌드에 -ffast-math 활성화 (llama.cpp PR #23862)
ggml-hip: enable -ffast-math for HIP builds by a-huk · Pull Request #23862 · ggml-org/llama.cpp
핵심 요약
AMD GPU용 llama.cpp 빌드에서 -ffast-math 옵션을 도입하여 프롬프트 처리 성능을 최대 7% 향상시키는 제안입니다.
- 성능 향상 — RDNA3.5 환경에서 프롬프트 처리 속도가 약 4~7% 개선되는 벤치마크 결과가 나옴.
- HIP 최적화 — AMD의 GPU 가속 플랫폼인 HIP 환경을 대상으로 한 컴파일러 옵션 최적화임.
- 정확도 우려 — 연산의 정확도를 희생하는 -ffast-math 옵션 사용에 대해 일부 사용자가 강한 우려를 표함.
- 실성능 저하 보고 — 특정 서버 설정(MTP 활성화)에서는 오히려 성능이 크게 떨어진다는 피드백이 있음.
github.com
원문 사이트로 이동
벤치마크
gfx1151 (RDNA3.5/Strix Halo, 40 CUs)에서 최신 master (2f6c815)를 기준으로 벤치마크를 수행했습니다. 이 두 모델은 두 가지 FA 경로를 모두 다룹니다.
Qwen3.5-27B Q4_K_M — head_dim=256 (TILE 경로), FA=1, 프롬프트 t/s:
| pp | upstream | + fast-math | delta |
|---|---|---|---|
| 512 | 307 | 321 | +4.6% |
| 2048 | 302 | 323 | +7.0% |
| 4096 | 300 | 312 | +4.0% |
| 8192 | 288 | 307 | +6.6% |
| 16384 | 263 | 280 | +6.5% |
| 32768 | 233 | 246 | +5.6% |
Qwen3-0.6B BF16 — head_dim=64 (MMA 경로), FA=1, 프롬프트 t/s:
| pp | upstream | + fast-math | delta |
|---|---|---|---|
| 512 | 9325 | 9642 | +3.4% |
| 2048 | 8609 | 8892 | +3.3% |
| 4096 | 7485 | 7661 | +2.4% |
| 8192 | 5770 | 5846 | +1.3% |
| 16384 | 3581 | 3636 | +1.5% |
| 32768 | 2037 | 2049 | +0.6% |
FA=0 결과는 두 빌드 모두에서 본질적으로 동일했습니다.


