Strix Halo 사용자 필독, 거절된 PR로 MoE 모델 PP 속도 최대 30% 향상 가능
Strix Halo users, a rejected PR can give you up to 30% faster PP for MOEs.
핵심 요약
AMD Strix Halo에서 MoE 모델의 prefill 속도를 최대 30% 높여주는 llama.cpp 패치 공유 및 성능 논쟁.
- 성능 향상 — 거절된 PR 적용 시 MoE 모델의 prefill(PP) 속도가 최대 30%까지 빨라짐.
- 메인테이너 논란 — 코드 품질 유지를 이유로 PR을 거절한 메인테이너의 태도와 기술적 판단에 대한 갑론을박.
- ROCm vs Vulkan — Strix Halo 환경에서 ROCm의 PP 강점과 Vulkan의 TG 강점에 대한 벤치마크 비교.
- 조건부 최적화 — 낮은 컨텍스트에서 효과가 가장 크며 컨텍스트가 길어질수록 이득이 감소함.
pedapudi가 올린 PR입니다.
https://github.com/ggml-org/llama.cpp/pull/21344
머지 요청이 거절되어서 메인라인 llama.cpp에는 들어가지 않을 예정입니다. 변경 사항이 아주 작아서 저는 그냥 현재 릴리스 버전의 llama.cpp에 직접 적용해서 쓰고 있습니다.
자세한 정보는 PR을 읽어보세요. MoE 모델에서만 작동합니다. 또한 낮은 컨텍스트에서 성능 향상이 가장 큽니다. 컨텍스트가 길어질수록 이득은 줄어듭니다. pedapudi가 PR에서 왜 그런 현상이 발생하는지 설명해 줍니다.
여기 수치들이 있습니다. 정말 잘 작동해요. 현재 릴리스 버전의 llama.cpp에 코드를 적용하는 데 드는 아주 짧은 시간은 충분히 가치 있는 투자입니다.
main
ggml_cuda_init: found 1 ROCm devices (Total VRAM: 128000 MiB):
Device 0: AMD Radeon Graphics, gfx1151 (0x1151), VMM: no, Wave Size: 32, VRAM: 128000 MiB
| model | size | params | backend | ngl | mmap | test | t/s |
| ------------------------------ | ---------: | ---------: | ---------- | --: | ---: | --------------: | -------------------: |
| qwen35moe 35B.A3B Q4_K - Small | 19.45 GiB | 34.66 B | ROCm | 99 | 0 | pp512 | 1106.11 ± 8.60 |
| qwen35moe 35B.A3B Q4_K - Small | 19.45 GiB | 34.66 B | ROCm | 99 | 0 | pp512 @ d10000 | 755.79 ± 2.58 |
| qwen35moe 35B.A3B Q4_K - Small | 19.45 GiB | 34.66 B | ROCm | 99 | 0 | pp512 @ d20000 | 587.61 ± 1.52 |
| qwen35moe 35B.A3B Q4_K - Small | 19.45 GiB | 34.66 B | ROCm | 99 | 0 | pp512 @ d40000 | 415.09 ± 2.45 |
| qwen35moe 35B.A3B Q4_K - Small | 19.45 GiB
PR
ggml_cuda_init: found 1 ROCm devices (Total VRAM: 128000 MiB):
Device 0: AMD Radeon Graphics, gfx1151 (0x1151), VMM: no, Wave Size: 32, VRAM: 128000 MiB
| model | size | params | backend | ngl | mmap | test | t/s | |
| ------------------------------ | ---------: | ---------: | ---------- | --: | ---: | --------------: | -------------------: | ---------------- |
| qwen35moe 35B.A3B Q4_K - Small | 19.45 GiB | 34.66 B | ROCm | 99 | 0 | pp512 | 1447.62 ± 7.10 | **+31%** |
| qwen35moe 35B.A3B Q4_K - Small | 19.45 GiB | 34.66 B | ROCm | 99 | 0 | pp512 @ d10000 | 905.60 ± 3.53 | **+20%** |
| qwen35moe 35B.A3B Q4_K - Small | 19.45 GiB | 34.66 B | ROCm | 99 | 0 | pp512 @ d20000 | 685.23 ± 3.03 | **+16%** |
| qwen35moe 35B.A3B Q4_K - Small | 19.45 GiB | 34.66 B | ROCm | 99 | 0 | pp512 @ d40000 | 459.42 ± 2.70 | **+11%** |
| qwen35m


