Strix Halo 사용자 주목: 공식 llama.cpp는 최적화가 부족합니다. 최고 성능을 내는 방법 공유
For Strix Halo - Official llama.cpp isn't ideal and how to highest possible throughput
핵심 요약
Strix Halo에서 공식 llama.cpp 대신 더 높은 처리량을 제공하는 최적화된 대안 프로젝트들을 소개합니다.
- 성능 최적화 — 공식 llama.cpp는 Strix Halo 하드웨어 잠재력을 50%밖에 활용하지 못함
- 대안 프로젝트 — halogen-flash-server, 실험적 포크, halo-box 등 더 빠른 처리량 제공
- 모델 추천 — Strix Halo 환경에서 Qwen 3.8 Flash Next 모델이 가장 효율적임
- 커뮤니티 검증 — 실제 사용자들이 더 빠른 디코드 및 프리필 성능을 체감함
Strix Halo(gfx1151) 최적 세팅에 대해 그동안 댓글을 많이 달았는데, 보니까 우리 커뮤니티 90%가 공식 llama.cpp를 쓰고 있더라고. 근데 그거 Strix Halo에 전혀 최적화 안 된 거 알지? 공식 llama.cpp는 하드웨어 이론 성능의 50%도 뽑아내기 버거워서 이 좋은 칩셋 성능을 다 낭비하고 있는 꼴이야.
Strix Halo의 속도를 차원이 다르게 끌어올려 줄 대안들을 가져왔어. 결과가 진짜라는 걸 증명하려고 유저들의 만족 후기 링크도 같이 달아둘게.
-
https://github.com/peonist-ai/halogen-flash-server - 디코드 약 50t/s, 프리필 1200t/s - 이론 성능 90% - Strix Halo와 Qwen 3.8 Flash Next(Q38FN - Strix Halo용 종결 모델) 전용으로 최적화됐어. 혹시 Ninfer 들어봤어? 이게 딱 Strix Halo판 Ninfer라고 보면 돼.
-
https://github.com/myhacsint/llama.cpp/tree/production/strix-halo-qwen4exp-b10685 - 디코드 거의 60t/s, 프리필 600t/s - 이론 성능 80% - 이건 Q38FN 실험용 포크인데, 디코드 속도가 엄청나고 프리필도 꽤 준수해.
-
https://github.com/halo-box/strix-llama.cpp - 디코드 거의 30t/s, 프리필 800t/s - 이론 성능 75% - 최근 커밋으로 프리필 속도를 미친 듯이 끌어올렸어. r/StrixHalo에서 가장 먼저 나온 포크고, 디스코드 서버에서 유저들이랑 계속 업데이트 중이야.
참고: 공식 llama.cpp로 Qwen38FN 돌리면 디코드 2xt/s에 프리필 2xxt/s 정도 나오는데, 이건 이론 성능의 50% 수준이야.
Strix Halo 쓰는 형들한테 도움 됐으면 좋겠다.

