MiniMax Sparse Attention (MSA)
핵심 요약
MiniMax가 공개한 고효율 희소 어텐션 기술인 MSA와 이를 적용한 109B 멀티모달 모델에 대한 소개입니다.
- MSA 기술 — GQA 기반의 블록 단위 희소 어텐션으로 연산 효율 극대화함
- 성능 향상 — 1M 컨텍스트에서 어텐션 연산량을 28.4배 줄이고 추론 속도를 대폭 개선함
- 공개된 리소스 — GitHub 코드와 Hugging Face 모델이 공개되어 활용 가능함
- 사용자 반응 — 특정 GPU 아키텍처에 최적화된 점에 대한 아쉬움과 범용 최적화 기대함
[블록 1/3] > 초장문 컨텍스트 처리 능력은 최첨단 LLM에게 필수적인 요소가 되고 있음: 에이전트 워크플로우, 레포지토리 단위의 코드 추론, 지속적인 메모리 유지 등은 모두 모델이 수십만에서 수백만 토큰을 동시에 처리할 것을 요구함. 하지만 소프트맥스 어텐션의 이차 비용(quadratic cost) 때문에 배포 규모에서는 이를 감당하기 어려움. 우리는 GQA(Grouped Query Attention)를 기반으로 구축된 블록 단위 희소 어텐션인 MiniMax Sparse Attention(MSA)을 소개함. 경량화된 인덱스 브랜치가 키-값 블록의 점수를 매기고 각 GQA 그룹에 대해 독립적으로 Top-k 서브셋을 선택하여, 효율적인 블록 단위 실행을 유지하면서 그룹별 희소 검색을 가능하게 함. 메인 브랜치는 선택된 블록에 대해서만 정확한 블록 희소 어텐션을 수행함. 단순성과 확장성 원칙에 따라 설계된 MSA는 의도적으로 간소화되어 다양한 GPU에서 효율적으로 배포하기 쉬움. 희소성을 실제 속도 향상으로 연결하기 위해, 우리는 exp-free Top-k 선택과 KV-outer 희소 어텐션을 사용하는 GPU 실행 경로를 MSA와 함께 공동 설계하여 블록 단위 접근 시 텐서 코어 활용도를 높였음. 네이티브 멀티모달 학습이 적용된 109B 파라미터 모델에서, MSA는 GQA와 동등한 성능을 내면서도 1M 컨텍스트에서 토큰당 어텐션 연산량을 28.4배 줄였음. 공동 설계된 커널과 결합하여 MSA는 H800에서 prefill 14.2배, 디코딩 7.6배의 실시간 속도 향상을 달성함. 추론 커널은 다음 링크에서 확인 가능함: 이 링크. MSA로 구동되는 프로덕션급 네이티브 멀티모달 모델이 공개됨: 이 링크.
[블록 2/3] 소비자용 GPU와 RAM에서 돌릴 수 있는 109B 모델이 있으면 좋을 텐데. 논문에서 그 모델을 보고 바로 이 글을 씀 :) 누군가 HF에서 그 모델에 대해 좀 물어봐 줬으면 좋겠음.
[블록 3/3] - arXiv : https://arxiv.org/abs/2606.13392


