[논문] DLoop: 루프형 추측 디코딩
[Paper] DLoop: Looped Speculative Decoding
핵심 요약
검증 전 여러 번의 드래프트 단계를 거쳐 타겟 모델의 연산 부담을 줄이는 새로운 추측 디코딩 방식인 DLoop이 공개되었습니다.
- DLoop 제안 — 검증 전 여러 드래프트 단계를 반복 수행하여 타겟 모델의 연산 횟수를 최적화함
- 성능 향상 — 기존 추측 디코딩 대비 5~41%의 속도 향상을 달성하면서도 무손실 디코딩을 유지함
- 루프 인식 학습 — 드래프트 모델이 검증되지 않은 토큰의 히든 스테이트를 학습하여 신뢰도를 유지함
- 코드 공개 예정 — 현재 내부 검토 중이며 곧 GitHub를 통해 공개될 예정임
Speculative decoding은 거대 언어 모델의 자기회귀적 생성 속도를 높여주는 기술임. 각 드래프트 단계에서 가벼운 드래프트 모델이 토큰을 제안하면, 타겟 모델이 이를 검증하는 방식이지. 드래프트 모델 성능이 점점 좋아지면서, 타겟 모델이 드래프트 단계에서 생성된 토큰을 전부 다 받아들이는 경우가 많아졌음. 그런데도 매번 검증 과정을 거치니까, 사실 드래프트를 더 이어갈 수 있는데도 타겟 모델이 불필요하게 포워드 패스를 돌리는 낭비가 발생함. 적응형 드래프트 길이 조절 방식이 디코딩 중에 검증 전까지 몇 개의 토큰을 생성할지 결정하긴 하지만, 이건 자기회귀적 드래프트 모델에서만 속도 향상이 있음. 병렬 드래프트 모델의 경우, 검증되지 않은 토큰에 대해 타겟 모델의 히든 스테이트가 필요해서 드래프트를 더 이어가기가 까다로움. 그래서 우리는 DLoop를 제안함. 이건 speculative decoding을 루프 형태로 돌려서, 검증 전에 여러 번의 드래프트 단계를 적응적으로 수행하는 방식임. DLoop는 드래프트 모델이 확신을 가지고 있는 동안에는 계속 드래프트를 이어가다가, 나중에 쌓인 토큰을 한꺼번에 검증함. Loop-aware training을 통해 드래프트 모델이 검증되지 않은 토큰의 히든 스테이트를 직접 보게 함으로써 추가적인 드래프트 단계에서도 신뢰성을 유지하도록 했음. 드래프트 모델의 포워드 패스를 좀 더 쓰는 대신, 타겟 모델의 검증용 포워드 패스 횟수를 줄이는 전략이지. EAGLE-3, DFlash, Domino, DSpark, 멀티 토큰 예측 모듈 등 다양한 speculative decoding 방식에 DLoop를 적용해 본 결과, 손실 없는 디코딩을 유지하면서도 실제 처리 속도를 5%에서 41%까지 끌어올렸음. 코드는 https://github.com/naver-ai/DLoop에서 곧 공개할 예정임.
-
Paper : https://arxiv.org/abs/2610.07659
-
PDF :

