Strix Halo 미니 PC에서 구동하는 Qwen3.8-Flash-Next (125B): 추론 엔진 공개 및 성능 공유
Qwen3.8-Flash-Next (125B) on a single Strix Halo mini PC: 44-59 tok/s with speculative decoding, ~1,400 tok/s prefill, engine is open
핵심 요약
Strix Halo 환경에서 Qwen3.8-Flash-Next를 구동하는 오픈소스 엔진 Kyojin이 공개되었습니다.
- 성능 최적화 — 추론 엔진 Kyojin을 통해 44~59 tok/s의 속도와 높은 모델 충실도 달성함
- 하드웨어 효율성 — Strix Halo 환경에서 저전력으로 SOTA급 모델 구동 가능함
- 오픈소스 협업 — 커뮤니티와 함께 엔진 성능을 개선하고 다양한 벤치마크를 공유함
- 비전 기능 지원 — 비전 타워가 포함되어 기본적으로 이미지 인식 기능을 제공함
다들 안녕. 지난 몇 주 동안 AMD Strix Halo 박스(Ryzen AI Max+ 395, 128GB)에서 Qwen3.8-Flash-Next(125B MoE, 6B active)를 제대로 돌리려고 빡세게 굴렸다. 오늘 밤에 95GB짜리 EXL3 가중치랑 우리 추론 엔진인 Kyojin(ExLlamaV3 기반, 오픈 소스) 새 버전을 같이 푼다.
이건 GLM-5.3-Flash나 MiMo-V2.6-Flash 빌드랑 마찬가지로 일단 내놓는 첫 버전이다. 그냥 빨리 공개하고 다 같이 개선하는 게 낫겠다 싶어서. 셋 다 속도랑 퀄리티 업데이트 계속 올라올 거다.
미니 PC에서 새로 빌드해서 뽑은 수치들이다:
-
Decode: speculative decoding 썼을 때 작업에 따라 44~59 tok/s 나옴(채팅 ~47, 코드 ~58, 복사 위주 편집 ~60). 안 쓰면 32.7 tok/s.
-
Prefill: 4K에서 1,412 tok/s, 32K에서 1,486 tok/s, 128K에서 1,367 tok/s(서버 보고 기준). 거의 일정하게 유지됨.
-
Long context: 64K랑 128K에서 needle 10/10 통과, 128K에서도 32 tok/s 유지함.
-
Fidelity: 844개 포지션에서 원본 FP8 모델이랑 top-1 일치율 94.1%.
우리가 좀 고집부리는 부분이 하나 있는데, 여기서 speculative decoding은 일반 디코딩이랑 토큰값이 완전히 똑같이 나온다. 릴리즈할 때마다 매번 체크하는 거니까 믿어도 됨.
비교하자면, 어떤 llama.cpp 유저가 같은 미니 PC에서 speculation 썼을 때 30 tok/s, prefill 500 tok/s 정도 나온다고 올렸더라(Vulkan, UD-IQ4_XS). 이건 우리가 측정한 게 아니라 그쪽 수치임: https://github.com/ggml-org/llama.cpp/discussions/28512
이제 우리가 1등 못 한 부분 얘기하자. Halogen 0.16.2(v2 체크포인트)가 우리보다 빠르다. 일반 디코딩은 39.8 vs 32.7 tok/s, speculation 쓴 채팅은 52 vs 47 tok/s, prefill은 클라이언트에서 똑같이 쟀을 때 10~20% 정도 앞섬(4K에서 1,306 vs 1,460, 16K에서 1,394 vs 1,720 정도). 코드 쪽은 우리가 비등하게 따라감(중앙값 기준 58.5 vs 51.2, 예열되면 걔네가 앞서긴 함). 우리가 더 나은 건 원본 모델이랑 얼마나 똑같냐는 건데, 우리 일치율은 94.1%고 걔네는 92.3%임. KL divergence도 우리가 41% 더 낮다. 전체 표는 모델 카드에 있으니 확인해 봐. 다음 목표는 이 속도 차이 줄이는 거다. 엔진 코어 싹 다 갈아엎는 중인데, 이거 되면 이 모델뿐만 아니라 돌아가는 모든 모델 성능이 다 올라갈 거다. 하드웨어 성능 아직 남았거든.

