보급형 스마트폰에서 3.5 tok/s로 구동되는 Qwen 3.8 Flash Next
Qwen 3.8 Flash Next locally on simple mobile phone at 3.5 tok/s
핵심 요약
40~50만 원대 안드로이드 폰에서 최적화와 양자화를 통해 Qwen 3.8 Flash Next 모델을 초당 3.5 토큰 속도로 구동함.
- 성능 최적화 — 보급형 스마트폰에서 효율적인 양자화로 LLM 구동함
- 구동 속도 — 초당 3.5 토큰의 실용적인 속도를 확보함
- 하드웨어 사양 — 12GB RAM을 탑재한 중급형 안드로이드 기기에서 테스트함
- 오픈 소스 — BigMoeOnEdge 프로젝트를 활용하여 모바일 환경에서 LLM을 실행함
Qwen 3.8 Flash Next (80gb) 모델이 최적화 몇 개랑 덴스 파트 양자화 좀 낮춘 덕분에 12gb짜리 중급형 안드로이드 폰에서 3.5 tok/s 찍히네.
프로젝트 홍보하려는 건 아니고, 그냥 400~500달러짜리 폰으로도 이게 가능하다는 걸 보여주고 싶었음.



