RTX 5090과 Qwen3.6으로 초당 3,000 토큰 달성 가능할까? (open-dllm)
Can a 5090 with qwen3.6 achieve > 3,000 tok/s ? bring your pitchforks (open-dllm)
핵심 요약
RTX 5090과 Qwen3.6을 활용해 확산 모델 기반의 초고속 LLM 추론을 시도한 실험적 프로젝트.
- LDLM 기술 — 확산 모델을 LLM에 적용해 추론 속도를 획기적으로 개선함.
- RTX 5090 벤치마크 — 35B-A3B 모델 기준 초당 3,000 토큰 이상의 성능을 기록함.
- 실험적 한계 — 짧은 시퀀스 길이와 미학습 가중치 사용으로 실제 성능 검증이 필요함.
- 오픈소스 공개 — Qwen3.6 기반의 LDLM 구현 코드를 깃허브에 공유함.
배경 설명 - Fred Zhangzhi Peng, Shuibai Zhang, Alex Tong 등이 AR(자기회귀) 모델을 확산 모델로 변환하는 작업을 진행했습니다. (이미 이전 모델들에서 작동 중입니다.)
저는 코드베이스를 포크해서 무료 deepseek-flash / GLM5.1을 사용해 밤새 opencode로 돌리며 Qwen3.6을 지원하도록 업그레이드했습니다. 코드베이스가 6개월 이상 된 것이라, 최근 논문인 LDLM을 AI를 통해 섞어 넣었습니다. https://arxiv.org/pdf/2605.07933v1 Viacheslav Meshchaninov, Alexander Shabalin, Egor Chimbulatov, Nikita Gushchin, Ilya Koziev, Alexander Korotin, Dmitry Vetrov 등 이 연구진은 이 논문을 구현하는 데 3년을 쏟았습니다.
https://x.com/Viacheslav91112/status/2054613430082957443?s=20
저는 Qwen 3.6 모델용 설정을 만들고 LDLM으로 업그레이드한 뒤, '솔직한' 가정하에 출력 수치를 추산해달라고 요청했습니다. 가장 큰 변수는 시퀀스 길이인데, 출력이 길어질수록 처리량은 떨어질 가능성이 높습니다.
추론 처리량 (Qwen3.6 LDLM, 미학습, RTX 5090 32GB)
| 모델 | 차원 | 학습 파라미터 | 확산 단계 | 처리량 |
| :--- | :--- | :--- | :--- | :--- |
| Qwen3.6-35B-A3B | 2048 | 1.39B | 10 | 3,238 tok/s |
| Qwen3.6-35B-A3B | 2048 | 1.39B | 4 | ~6,500 tok/s |
| Qwen3.6-27B | 5120 | 6.75B | 10 | 745 tok/s |
| Qwen3.6-27B | 5120 | 6.75B | 4 | ~1,500 tok/s |

