Domino: 추론 디코딩에서 인과 모델링과 자기회귀 드래프팅을 분리하기
Domino: Decoupling Causal Modeling from Autoregressive Drafting in Speculative Decoding
핵심 요약
Qwen3 모델에서 최대 5.8배의 처리량 향상을 보여주는 새로운 추론 디코딩 기법인 Domino가 공개되었습니다.
- 성능 향상 — Qwen3 모델에서 최대 5.8배의 처리량 속도 개선을 달성함
- 기술적 특징 — 추론 디코딩에서 인과 모델링과 자기회귀 드래프팅을 분리하여 효율성을 높임
- 유연성 — 기존 모델에 적용 가능하며 전체 모델을 재학습할 필요가 없음
- 관련 자료 — 논문, 코드, 모델 가중치를 공개하여 접근성을 높임
Qwen3에서 최대 5.8배의 처리량 속도 향상
-
Paper : https://arxiv.org/abs/2605.29707
-
Models : https://huggingface.co/Huang2020


