Strix Halo에서 돌린 Qwen3.8-27B Q8_0 성능 진짜 인상적이네
Qwen3.8-27B Q8_0 on Strix Halo is seriously impressive
핵심 요약
Strix Halo 환경에서 Qwen3.8-27B 모델을 활용해 복잡한 에이전트 작업을 성공적으로 수행한 사례 공유.
- 성능 테스트 — Strix Halo 환경에서 Qwen3.8-27B 모델로 비행 시뮬레이터 생성함.
- 기술 스택 — Lemonade Server와 llama.cpp ROCm, MTP speculative decoding을 조합함.
- 속도 논쟁 — 실사용 시 프리필(prefill) 속도 문제로 인해 실무 활용 가능성에 대한 의견이 갈림.
- 모델 능력 — 코드 생성 및 디버깅 능력은 뛰어나지만 대규모 코드베이스 작업에는 속도가 아쉬움.
대충 써서 미안한데, ROG Flow Z13(Ryzen AI Max+ 395, 128GB 통합 메모리)에서 Qwen3.8-27B Q8_0 로컬로 돌려보면서 이 모델 성능에 진짜 감탄했다. 내가 모델 이것저것 진짜 많이 테스트해봤는데, 이 짧은 시뮬레이터 제대로 만들어낸 건 이 모델이 유일함.
프롬프트:
"Create a beautiful, relaxing flight simulator in a single HTML page."
파일/bash 툴 쓰는 에이전트 써서 이거 통째로 다 뽑아내더라.
셋업:
Lemonade Server + llama.cpp ROCm
Q8_0 가중치 + Q8 KV 캐시
Native MTP speculative decoding
64GB VRAM / 64GB RAM 분할
~142k 컨텍스트
에이전트 단계마다 다르긴 한데 대충 9~19 tok/s 정도 나오고, 잘 나올 땐 16~19 tok/s 유지함. MTP 수락률은 97~99% 찍히고, 시뮬레이터 다 만드는 데 20분 정도 걸렸다.


