[논문] ToMoE: 동적 구조적 가지치기를 통해 밀집형 거대 언어 모델을 전문가 혼합(MoE) 모델로 변환하기
[Paper] ToMoE: Converting Dense Large Language Models to Mixture-of-Experts through Dynamic Structural Pruning
핵심 요약
밀집형 모델을 성능 저하 없이 전문가 혼합(MoE) 구조로 변환하는 새로운 동적 가지치기 기법인 ToMoE를 소개합니다.
- 동적 가지치기 — 모델 파라미터를 영구 삭제하지 않고 활성 파라미터 수를 고정함
- MoE 변환 — MLP 레이어를 전문가 혼합 구조로 전환하여 효율성 극대화
- 성능 우위 — 파인튜닝 없이도 기존 구조적 가지치기 기법보다 뛰어난 성능 입증
- 범용성 — Phi-2, LLaMA-3, Qwen-2.5 등 다양한 모델군에서 효과 확인
arxiv.org
원문 사이트로 이동
ToMoE: 동적 구조적 가지치기(Dynamic Structural Pruning)를 통한 Dense 거대 언어 모델의 Mixture-of-Experts 변환
거대 언어 모델(LLM)은 복잡한 작업들을 처리하는 데 엄청난 능력을 보여줬음. 근데 모델 덩치가 너무 커서 연산량이나 메모리 비용 때문에 리소스 빡빡한 기기에서 돌리거나 서비스하기가 존나 힘든 게 현실임. 기존 방식들은 중요도 낮은 모델 구조를 영구적으로 삭제해서 이 문제를 해결하려고 했는데, 이러면 파라미터가 아예 날아가 버려서 성능이 팍 깎이는 경우가 많았음. 그래서 이번 연구에서는 파라미터를 영구 삭제하지 않고 활성 파라미터 수만 줄이는 방식으로 이 문제를 해결해 보려고 함. 구체적으로는 MLP 레이어를 Mixture of Experts(MoE) 아키텍처로 바꿔서 Dense 모델이 고정된 수의 활성 파라미터만 유지하게 만드는 미분 가능한 동적 가지치기 방식을 도입했음. 우리 방식은 파인튜닝 없이도 Phi-2, LLaMA-2, LLaMA-3, Qwen-2.5 같은 다양한 모델 계열에서 기존 구조적 가지치기 기법들보다 훨씬 뛰어난 성능을 보여줌.
-
arXiv : https://arxiv.org/abs/2501.15316
-
Full Paper PDF : https://arxiv.org/pdf/2501.15316
-
GitHub : https://github.com/gaosh/ToMoE (오, 코드도 공개됨)
-
OpenReview : https://openreview.net/forum?id=RFHq46pjb6
누가 Qwen3.8-27B나 Muse-Glimmer-30B 같은 최신 Dense 모델들로 MOE 모델 좀 만들어주라.
내 예전 글에 이거 공유해 준 u/KSAM-The-Randomizer 고맙다.

