gfx906-llama-cpp: MI50/MI60/Radeon VII/AMD GCN을 위한 새로운 PP/TG 성능 향상
gfx906-llama-cpp: New PP/TG gains for MI50/MI60/Radeon VII/AMD GCN
핵심 요약
AMD GCN 아키텍처 기반 GPU를 위한 llama.cpp 포크의 성능 개선 및 업데이트 소식입니다.
- 성능 향상 — prefill 및 TG 속도 개선으로 최대 23% 성능 향상 달성
- README 업데이트 — 포크의 목적과 기여자를 명확히 정리한 문서 추가
- 하드웨어 지원 — MI50, MI60, Radeon VII 등 GCN 아키텍처 지원 강화
- 지속적 유지보수 — 작성자가 직접 실사용하며 업데이트를 이어가고 있음
또 업데이트할 시간이다! 그동안 바쁘게 움직여서 성능 향상을 꽤 많이 이뤄냈음 (주로 기존 llama cpp PR들을 훑어보고 필요한 것들을 가져온 덕분임).
다른 것들 중에서도 README.md를 추가해서 이 포크에 뭐가 들어있는지, 왜 들어있는지, 누가 만들었는지 한눈에 보기 좋게 정리해 뒀음.
| metric | upstream t/s | fork t/s | gain |
|---|---|---|---|
| prefill PP16384 | 332.5 | ~410 | +23% |
| 120k deep fill | 231.4 | ~264 | +14% |
| TG | 13.6 | ~15.1 | +11% (parity pre-mirror) |
| context | cannot fit | 250k on 40 GB | tight-fit machinery |
| outputs | - | - | bit-identical (sha + token-for-token) |
https://github.com/milpster/gfx906-llama-cpp/blob/master/README.md
(맞음, 이거 AI로 쓴 거임)


