128GB 미니 PC(AMD Strix Halo) 한 대에서 돌아가는 300B급 MoE 모델 2종: GLM-5.3-Flash(프리필 ~580 tok/s), MiMo-V2.6-Flash(디코드 최대 44 tok/s). EXL3 가중치 및 오픈 ROCm 엔진 사용
Two ~300B MoE models, each on ONE 128 GB mini PC (AMD Strix Halo): GLM-5.3-Flash at ~580 tok/s prefill, MiMo-V2.6-Flash up to 44 tok/s decode. EXL3 weights + open ROCm engine
핵심 요약
128GB Strix Halo 미니 PC에서 300B급 MoE 모델을 구동하는 고성능 엔진 'Kyojin'이 공개되었습니다.
- 고성능 엔진 — ExLlamaV3 기반의 Kyojin으로 300B급 모델 구동함.
- 하드웨어 최적화 — AMD Strix Halo의 통합 메모리 환경에서 ROCm으로 가속함.
- 모델 성능 — GLM-5.3 및 MiMo-V2.6 모델로 높은 프리필/디코드 속도 달성함.
- 커스텀 양자화 — 2.05~3.05 bpw 혼합으로 메모리 효율과 성능 균형을 맞춤.
Strix Halo(gfx1151, ROCm)용으로 ExLlamaV3 기반의 Kyojin 엔진을 만들었고, 300B급 MoE 모델 두 개를 128GB 장비 한 대에 각각 들어갈 수 있게 때려 박았다. 첫 릴리즈고, 전부 Ryzen AI Max+ 395에서 측정함.
| Model | GLM-5.3-Flash | MiMo-V2.6-Flash-MOPD |
|---|---|---|
| Size | 99.7 GB | 105 GB |
| Prefill | 580 tok/s at 3.5K, 546 at 64K | about 650 tok/s at 4K |
| Decode | 26 to 30 tok/s (MTP) | 32 prose / 35 chat / 44 code (speculative), 29 plain |
| KLD vs official FP8 | 0.151 | 0.0713 |
| Top-1 agreement with FP8 | 89.3 % | 92.0 % |
가중치 출처. MiMo는 우리가 직접 양자화한 거임. GLM 팩은 turboderp가 공개한 2.05 bpw랑 3.05 bpw EXL3 텐서를 섞고, 우리만의 레이어 조합이랑 약간의 튜닝 단계를 거쳤다. 동일한 129개 행에서 turboderp의 2.05 bpw 팩(85GB)은 KLD 0.275가 나오는데, 우리 조합(100GB)은 0.190 찍힘. 걔네 게 용량은 더 작고 디코딩 속도는 10% 정도 더 빠름.
Uncensored 버전. -Uncensored 레포는 따로 있음. 가중치는 똑같고 엔진이 로드할 때 적용하는 작은 파일 하나가 추가되는데, 스위치 하나로 끄고 켤 수 있음.
아직 측정 안 함. MiMo의 태스크 스위트 점수, 128K 컨텍스트에서의 GLM, gfx1151 이외의 GPU는 아직 테스트 안 했다. 변환 파이프라인은 비공개임.
