Qwen3.8 Flash Next, Strix Halo에서 1.2k t/s prefill 달성
Qwen3.8 Flash Next now at 1.2k t/s prefill on Strix Halo
핵심 요약
작성자가 오픈소스 llama.cpp에서 Qwen3.8 Flash Next의 prefill 성능을 1.2k t/s까지 끌어올리는 데 성공함.
- 성능 최적화 — Strix Halo 환경에서 Qwen3.8 Flash Next의 prefill 속도를 1.2k t/s로 개선함.
- 오픈소스 기여 — 폐쇄형 솔루션인 Halogen에 대응해 llama.cpp 메인라인에 적용할 최적화 작업을 진행함.
- 기술적 성과 — 희소 어텐션(sparse attention) 최적화를 통해 GLM 5.3 Flash 아키텍처에도 도움을 줄 예정임.
- 향후 계획 — 최적화 코드를 정리하여 llama.cpp 메인라인 및 커뮤니티 포크에 PR을 제출할 예정임.
pwilkin.github.io
원문 사이트로 이동
다들 알다시피 메인라인 llama.cpp의 Qwen3.8 Flash Next는 아직 꽤 실험적인 단계지만, 커뮤니티 포크들이 어떻게든 더 잘 돌아가게 만들려고 애쓰는 중이야. Halogen(https://github.com/peonist-ai/halogen-flash-server)이라는 클로즈드 소스 솔루션도 있는데, 커뮤니티 포크가 겨우 400 t/s 찍을 때 지들은 1.2k t/s 나온다고 자랑질을 하더라고. 난 클로즈드 소스 딱 질색이고 오픈 소스 좋아해서, 직접 도전해 보기로 했지. llama.cpp 성능을 그 수준까지 끌어올려 보려고 며칠 밤새우고 토큰 엄청나게 태운 끝에 결국 해냈다.
링크에는 내가 디버깅하고 최적화했던 전체 과정(Opus로 요약함)이 담겨 있고, 당연히 브랜치 링크랑 (화려하게 부활한) 커스텀 HIP 런타임, 한 번에 안 돌아갈 확률 99%인 설치 스크립트, 그리고 벤치마크 결과까지 다 들어있어. 메인라인이랑 커뮤니티 포크, 그리고 내 거 같은 커스텀 포크/브랜치들이 어떻게 돌아가는지 생태계 설명도 좀 넣어놨어. 이제 결과물도 뽑았으니 코드 정리해서 메인라인에 제대로 PR 날릴 생각이야(커뮤니티 포크 쪽에도 깔끔하게 PR 보낼 예정). 이게 GLM 5.3 Flash 아키텍처도 비슷한 sparse attention을 쓰니까 거기에도 도움이 될 거야.

