엔비디아의 Nemotron-Labs-Diffusion 모델 공개
Nemotron-Labs-Diffusion from NVIDIA
핵심 요약
AR 디코딩과 확산 모델을 결합해 추론 효율을 극대화한 새로운 언어 모델 아키텍처.
- 모델 아키텍처 — AR 디코딩과 확산 기반 병렬 디코딩을 상황에 맞춰 전환 가능함.
- 자기 추론(Self-speculation) — 확산 모델로 초안을 잡고 AR로 검증하여 디코딩 속도를 획기적으로 높임.
- 성능 향상 — 기존 모델 대비 훨씬 높은 토큰 처리량과 효율적인 연산 자원 활용을 보여줌.
- 실제 적용 — 다양한 하드웨어 환경에서 메모리 대역폭 한계를 극복하고 추론 속도를 가속함.
Model Overview
Nemotron-Labs-Diffusion은 추론 중에 동일한 모델의 어텐션 패턴을 간단히 전환함으로써 AR 디코딩과 확산 기반 병렬 디코딩을 모두 지원하는 3중 모드 언어 모델입니다. 이 두 모드 간의 시너지는 '자기 추론(self-speculation)'이라는 세 번째 모드를 가능하게 합니다. 동일한 모델이 공유 KV 캐시를 사용하여 확산 기반 병렬 초안 작성과 AR 검증을 동시에 수행함으로써, 높은 수용 길이와 디코딩 효율을 달성합니다. 어텐션 패턴 변경만으로 원활하게 모드를 전환할 수 있어, 단일 모델로 다양한 배포 시나리오와 동시성 수준에서 높은 효율성을 제공합니다.
Highlights
- AR, 확산, 자기 추론을 지원하는 SOTA급 3B, 8B, 14B 밀집 LM 제품군(베이스, 인스트럭트, 비전-언어 변형)으로 디코딩 효율에 집중함.
- 생성이 메모리 제한 체제에서 연산 제한 체제로 이동함. 모델 가중치를 한 번 로드하면 생성 과정에서 여러 토큰을 계산하는 데 재사용됨.
- 자기 추론은 초안 작성에 확산을, 검증에 AR을 사용하여 MTP 접근 방식보다 강력한 대안을 제공함:
- SGLang에서 Qwen3-8B-Eagle3 대비 3배 높은 수용 길이와 2.2배 속도 향상.
- 동일 정확도에서 Qwen3-8B(MTP 없음) 대비 포워드당 토큰 수 5.9배 증가.
- 플랫폼 전반의 실제 기기 속도 향상:
- DGX Spark (8B, 동시성 1): w4a16 사용 시 AR 대비 112 tok/sec로 2.7배 빠름 (기존 41.8 tok/sec).
- GB200 (8B, 동시성 1): AR 대비 850 tok/sec(기존 253 tok/sec), Eagle3 대비 360 tok/sec로 3.3배 빠름. 커스텀 CUDA 커널 적용 시 1015 tok/sec(4배)까지 가속.
- 확산 속도 분석에 따르면 처리량은 현재 대비 2배 더 향상될 수 있음.
https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-VLM-8B
https://huggingface.co/nvidia/Nemotron-Labs-Diffusion-14B-Base


