MoE 모델의 토큰당 활성 파라미터 증가(Qwen 35B A4B+)로 추론 토큰 8.5% 감소 - 학습이나 파인튜닝 불필요!
Increasing active parameters per token in MOE (Qwen 35B A4B+) reduce reasoning token by 8.5% - and you don't need to train or finetune!
핵심 요약
MoE 모델의 후반부 레이어에서 전문가 선택을 늘려 추론 효율을 높이는 추론 시간 최적화 기법을 제안함.
- 추론 최적화 — 후반부 레이어의 전문가 선택을 늘려 추론 토큰과 지연 시간을 줄임
- 성능 유지 — 정확도 저하 없이 추론 효율성만 개선함
- 학습 불필요 — 모델 재학습이나 파인튜닝 없이 런타임 라우팅 수정만으로 구현
- 향후 과제 — DeepSeek V4 Flash 등 더 큰 모델로 실험 확장 계획
희소 MoE 추론 모델을 위한 간단하지만 놀랍도록 효과적인 최적화 방법을 다룬 논문이 방금 나와서 공유하려고 함.
핵심 아이디어: 뭘 다시 학습시킬 필요 없이, 그냥 런타임에 라우터만 살짝 건드리는 거임. 구체적으로는 뒤쪽 트랜스포머 레이어에서만 전문가 선택 예산(N≥K)을 늘리고, 추가된 전문가들한테는 선형 감쇠 계수를 적용함. 앞쪽 레이어는 건드리지 않음. 그러니까 Qwen 3.6 35B A3B가 **Qwen 3.6 35B A4B+**가 되는 거지!
발견한 점 — "간결한 수렴(Succinct Convergence)":
모델이 결정을 내리는 데 중요한 마지막 레이어들에서 전문가 용량을 더 쥐여주니까, 모델이 헛소리를 안 함. 훨씬 짧은 추론 과정을 거쳐서 똑같은 정답을 찾아냄.
전체 MMLU-Pro 결과 (714개 질문, Qwen3.6-35B-A3B):
-
📉 평균 추론 토큰 8.5% 감소
-
⚡ 지연 시간 10.9% 단축 (p=6.5×10−6)
-
🎯 정확도 변화 없음 (84.5% vs 84.0% 네이티브, p=0.77 — 통계적으로 차이 없음)
-
🆓 학습 비용 제로 — 순수하게 추론 시점 라우팅만 수정함
링크:
거기 들어가면 내 깃허브 저장소(베타 버전 코드 있음)랑 MMLU-Pro 벤치마크 상세 JSON 결과도 볼 수 있음.
나중에는 DeepSeek V4 Flash Q2.0 같은 더 큰 모델로도 똑같이 실험해보고 싶음.
나 영어 원어민 아니라서, 이 글 일부는 번역 문제 때문에 AI 도움을 좀 받아서 작성했음.


