Halogen + Qwen Flash Next, 점점 더 좋아지는 중
Halogen + Qwen Flash Next keeps getting better
핵심 요약
Halogen 0.17.2 업데이트로 Qwen 3.8 Flash Next의 성능이 비약적으로 향상되어 로컬 환경에서도 뛰어난 효율을 보여줌.
- 성능 향상 — Halogen 0.17.2 업데이트로 고컨텍스트 환경에서 45 tps 수준의 속도 달성함.
- 모델 효율성 — 177B 규모의 Qwen 3.8 Flash Next 모델이 로컬에서 매우 높은 품질의 결과물을 생성함.
- 폐쇄형 논란 — 뛰어난 성능에도 불구하고 오픈소스가 아니라는 점 때문에 프라이버시를 중시하는 사용자들에게 비판받음.
- 생태계 확장 — NPU용 소형 모델 및 에이전트 도구와의 연동을 통해 로컬 AI 환경의 활용도가 넓어짐.
최신 Halogen 버전 업데이트(0.17.2)로 128GB Strix Halo 환경에서 Qwen 3.8 Flash Next 돌려보니까, 컨텍스트 길게 잡아도 decode 속도가 45 tps 정도로 꾸준히 뽑히네. u/peonist-ai 형 진짜 대단하다. QFN으로 커밋을 계속 찍어내고 있는데, 1770억 파라미터급 모델치고 성능 미쳤음. 솔직히 우리가 이 정도면 저평가하고 있는 거 아니냐? 😂 QFN이 검토하고 짠 Opus 5.5 계획안 퀄리티 진짜 지린다 ❤️

