Strix Halo에서 1M 컨텍스트로 구동한 Qwen3.8-Flash-Next: 38 tok/s 디코드, 18분 프리필 (halogen 0.12.0)
Qwen3.8-Flash-Next at 1M context on Strix Halo: 38 tok/s decode, 18 min prefill (halogen 0.12.0)
핵심 요약
halogen 0.12.0 업데이트를 통해 1M 컨텍스트 환경에서의 성능 개선을 입증했으나, 오픈소스화 여부에 대한 사용자들의 요구가 빗발치고 있습니다.
- 성능 개선 — 1M 컨텍스트 환경에서 디코드 속도가 38.3 tok/s로 향상됨
- 업데이트 내용 — halogen 0.12.0 버전에서 컨텍스트 깊이에 따른 성능 저하 문제 해결
- 오픈소스 요구 — 대부분의 사용자가 프로젝트의 오픈소스화를 강력히 희망함
- 하드웨어 사양 — Ryzen AI Max+ 395 및 128GB RAM 환경에서 테스트 진행
안녕.
halogen이 컨텍스트 깊이가 깊어질수록 성능이 떨어진다는 피드백이 좀 있어서 수정했어.
같은 이미지, 같은 머신, 같은 세션, 같은 프롬프트로 0.11.10 버전이랑 0.12.0 버전 비교해 봤다:
-
1,004,581 토큰 컨텍스트에서 디코드: 27.3에서 38.3 tok/s로 상승 (기본 speculative drafter 사용)
-
258,794 토큰에서 디코드: 42.9에서 45.0으로 상승
-
1,004,581 토큰에서 프리필: 790에서 937 tok/s로 상승, 콜드 스타트 시간 21.2분에서 17.9분으로 단축
-
258,794 토큰에서 프리필: 1,086에서 1,114 tok/s로 상승
조건: Ryzen AI Max+ 395, 128 GB 사용. 262k랑 1M 행은 1M 설정(HALOGEN_ROPE_YARN=4 HALOGEN_CTX=1048576)에서 각각 콜드 리퀘스트 한 번씩 돌린 거고, greedy 방식에 64 토큰, 응답의 timings에 찍힌 속도 기준이야. 32k 행은 기존에 하던 10개 프롬프트 평균값이라 변동 없음. 1M에서 프롬프트 캐시를 활용한 후속 턴은 첫 토큰까지 0.55초 정도 걸려. 위에 적은 수치들은 전부 콜드 패스 기준이다.
1M으로 돌리려면: README에 있는 podman 명령어에 -e HALOGEN_ROPE_YARN=4 -e HALOGEN_CTX=1048576 옵션 추가하면 돼. 128 GB 램 박힌 머신이 필요함. 릴리즈 노트랑 전체 표는 여기 있어:
https://github.com/peonist-ai/halogen-flash-server
혹시 1M 스윕 데이터 가지고 있으면 0.12.0에서 다시 한번 돌려봐 주라.
항상 응원해 줘서 고맙다. 특히 https://huggingface.co/nightvich한테 고맙다는 말 전하고 싶네.

