Diffusion Gemma는 4배 더 빠르지만, 실수는 6배 더 많음!
Diffusion Gemma is 4x faster, but makes 6x more mistakes!
핵심 요약
Diffusion Gemma는 속도는 빠르지만, 텍스트 생성 시 사실 관계 오류가 잦아 실용성에는 한계가 있다는 분석입니다.
- 성능 비교 — Diffusion Gemma와 기존 Gemma4의 속도 및 정확도 벤치마크 수행함.
- 오류 원인 — 토큰을 한꺼번에 생성하고 다듬는 방식 때문에 사실보다 문맥의 매끄러움에 치중함.
- 기술적 한계 — 현재로서는 프로토타입 수준이며, 사실 관계가 중요한 작업에는 기존 모델 권장됨.
- 향후 전망 — 초기 생성은 Diffusion으로, 정교화는 소형 모델로 결합하는 방식이 기대됨.
Gemma 확산 모델을 기존 자기회귀 모델과 단일 H100(FP8) 환경에서 벤치마크함. 스티브 잡스 전기, 테트리스 역사, BeOS 이야기라는 세 가지 주제를 각각 맡겼는데, 뒤로 갈수록 인지도가 낮은 주제임. 그 후 모든 답변의 사실 관계를 검증함.
Gemma4는 45개 사실을 맞히고 5개 틀림. DiffusionGemma는 33개 맞히고 28개 틀림. 주제가 덜 유명할수록 결과는 더 나빠짐: 잡스 관련 4개, 테트리스 12개, BeOS 12개 실수. 스티브 잡스의 어머니를 Clara Clley라고 하거나, 파지트노프의 동료로 Geri Gulovik이라는 가상의 인물을 만들어내고, BeBox 가격을 $9,999로 책정함. 실제 가격은 $1,600였음.
결과:
Gemma4 26B A4B: 218 tok/s · 총 15.1초 · 45개 사실 · 5개 실수
DiffusionGemma 26B A4B: 763 tok/s · 총 3.7초 · 33개 사실 · 28개 실수
이유는 간단함. DiffusionGemma는 256개의 토큰을 한꺼번에 화면에 뿌리고 텍스트가 매끄럽게 들릴 때까지 반복해서 다듬음. 오직 '매끄러움'만 신경 쓰기 때문에 가짜 이름, 날짜, 숫자가 진짜처럼 들리면 그대로 유지됨. 반면 일반 Gemma4는 한 번에 한 단어씩 작성하며 새로운 단어를 이전의 모든 내용과 대조함. 구글도 출시 포스트에서 직접 밝혔듯이, 품질은 더 낮으니 사실 관계가 중요할 때는 일반 Gemma 4를 사용하라고 함.
오픈 소스 로컬 AI 모델 활용: Atomic.Chat (본인 운영, GGUF 모델, MLX Apple Silicon, MTP 및 긴 컨텍스트 윈도우를 위한 Google TurboQuant 지원, llama.cpp를 통한 Diffusion 지원 작업 중)



