DeepMind, 'DiffusionGemma' 공개 — 이미지 스타일 확산 모델을 통한 텍스트 생성
DeepMind Just Dropped "DiffusionGemma" — Text Generation via Image-Style Diffusion Model
핵심 요약
DeepMind가 기존의 순차적 생성 방식 대신 확산 모델을 사용하여 초고속 텍스트 생성이 가능한 'DiffusionGemma'를 공개했습니다.
- 확산 모델 방식 — 토큰을 순차적으로 생성하지 않고 전체 텍스트 블록을 동시에 생성함
- 압도적 추론 속도 — H100 기준 초당 1,000 토큰 이상의 속도로 텍스트 생성 가능
- 효율적 하드웨어 요구 — 26B MoE 모델이지만 추론 시 3.8B 파라미터만 활성화하여 18GB VRAM에서 구동
- 오픈 소스 생태계 — Apache 2.0 라이선스로 배포되며 vLLM, Unsloth 등과 즉시 호환됨
blog.google
원문 사이트로 이동
오늘 또 다른 오픈 웨이트 모델이 공개됐어. 이번엔 DeepMind에서 나온 건데, 오픈 소스 덕후들에겐 좋은 날인 것 같네.
Apache 2.0 라이선스로 출시됐어.
시장에 나와 있는 거의 모든 자기회귀 모델처럼 토큰을 하나씩 순차적으로 생성하는 대신, 텍스트 확산 헤드(text diffusion head)를 사용해.
- 화면에 256토큰짜리 '캔버스'를 무작위 노이즈로 채워.
- 균일 상태 확산(Uniform State Diffusion)을 사용해서 전체 텍스트 블록을 한 번에 반복적으로 다듬고 노이즈를 제거해.
- 모든 토큰이 다른 모든 토큰을 참조(attend)할 수 있기 때문에
- 재노이즈(Re-Noising)를 통한 오류 수정 기능도 있어. 생성 도중 모델의 확신도가 떨어지면 노이즈를 주입해서 실시간으로 스스로 실수를 수정한다는 뜻이야.
- 전체 블록을 한 번에 처리하기 때문에 로컬 추론의 병목 현상을 메모리 대역폭에서 순수 연산 능력으로 옮겨왔어. (NVIDIA H100 한 대에서 초당 1,000+ 토큰, RTX 5090 로컬 환경에서 초당 700+ 토큰)
하드웨어 요구 사양
Gemma 4 아키텍처를 기반으로 한 26B Mixture of Experts(MoE) 모델이지만, 추론 시에는 3.8B 파라미터만 활성화해. 양자화하면 18GB VRAM 안에 여유롭게 들어가서 로컬 PC 워크플로우에서 아주 쉽게 사용할 수 있어.
Hugging Face에 이미 올라와 있고 vLLM, Unsloth(파인튜닝용), Hugging Face Transformers와 즉시 호환돼.

