Orthrus-Qwen3-8B: Qwen3-8B 기반, 고정된 백본으로 최대 7.8배 토큰 처리 속도 향상 및 동일한 출력 분포 보장
Orthrus-Qwen3-8B : up to 7.8×tokens/forward on Qwen3-8B, frozen backbone, provably identical output distribution
핵심 요약
고정된 백본에 학습 가능한 확산 어텐션 모듈을 주입해 모델 정확도 손실 없이 추론 속도를 획기적으로 높인 기술.
- 확산 어텐션 모듈 — 고정된 백본에 학습 가능한 모듈을 주입해 추론 속도를 최대 7.8배 향상함.
- 정확도 유지 — 기존 모델과 동일한 출력 분포를 보장하며 성능 저하 없이 속도만 개선함.
- 추가 오버헤드 없음 — 외부 드래프터나 별도 캐시 없이 단일 KV 캐시를 공유해 TTFT 페널티를 제거함.
- 확장성 계획 — 현재 Qwen3 모델을 지원하며 향후 Qwen 3.5/3.6 및 MoE 모델로 지원 범위를 넓힐 예정임.
- Code: https://github.com/chiennv2000/orthrus
- Paper: https://arxiv.org/abs/2605.12825
- HF: https://huggingface.co/chiennv/Orthrus-Qwen3-1.7B ; https://huggingface.co/chiennv/Orthrus-Qwen3-4B ; https://huggingface.co/chiennv/Orthrus-Qwen3-8B
- Disclosure: 공동 저자.
아이디어: 고정된 AR Transformer의 각 레이어에 학습 가능한 확산 어텐션 모듈을 주입합니다. 두 헤드는 하나의 KV 캐시를 공유합니다. 확산 헤드는 K=32개의 토큰을 병렬로 투영하고, AR 헤드는 두 번째 패스에서 검증하여 가장 긴 일치 접두사를 수락합니다. 출력 분포는 기본 모델과 동일함이 증명되었습니다.
결과:
- MATH-500 기준 최대 7.8배 TPF, 약 6배의 실제 처리 속도 향상.
- 파라미터의 16% 학습, 1B 토큰 미만, 8×H200에서 24시간 소요.
- 기존 확산 LM(Dream, Fast-dLLM-v2, SDAR, Mercury, Gemini Diffusion) 대비: 이들은 기본 가중치를 수정하여 정확도를 잃음(Fast-dLLM-v2: MATH-500에서 -11점). Orthrus는 백본을 고정하여 Qwen3-8B와 정확도가 정확히 일치함.
- 추측적 디코딩(EAGLE-3, DFlash) 대비: 외부 드래프터나 별도의 캐시가 없으며, 별도의 드래프터 모델을 초기화하고 동기화할 필요가 없어 첫 토큰 생성 시간(TTFT) 페널티가 전혀 없음. KV 오버헤드는 O(1)(약 4.5 MiB) 수준임. MATH-500에서의 수락 길이는 11.7로, DFlash(7.9)나 EAGLE-3(3.5)보다 뛰어남.
- 단일 단계 디노이징이 다중 단계보다 우수함(6.35 vs 3.53 TPF). KL 증류가 수락률 면에서 CE보다 우수함.
한계: 고정된 기본 모델에 엄격히 제한됨(기본 모델의 편향, 환각, 지식 격차를 그대로 물려받음); Qwen3 전용 평가; 탐욕적 + 거부 샘플링만 지원.


