z-lab에서 gemma-4-26B-A4B-it-DFlash를 출시했는데, 혹시 써본 사람 있음?
z-lab released gemma-4-26B-A4B-it-DFlash. Anybody tried it yet?
핵심 요약
Gemma 4용 DFlash 기술의 성능과 MTP와의 비교, 그리고 실사용 경험에 대해 묻는 글.
- DFlash 기술 — 병렬 블록 확산 드래프팅을 통해 MTP보다 효율적인 추론 속도를 제공함.
- MTP 비교 — Gemma 4의 MTP는 KV 캐시를 재사용하는 독특한 방식으로 성능 저하가 적음.
- 실사용 후기 — 메모리 요구량이 MTP보다 높고 40k 이상의 컨텍스트에서 작동이 불안정함.
- 기술적 한계 — 현재 vLLM 전용으로 출시되어 llama.cpp 지원이 아직 미흡함.
지난 며칠간 다들 MTP 이야기만 하더군요. 어쩌다 보니 사람들이 Z lab에서 며칠 전에 Gemma 4 26B용 DFlash를 출시했다는 사실을 놓친 것 같습니다. 제가 이해하기로는 DFlash가 더 빠른 병렬 블록 확산 드래프팅이 가능하고, 상태 유지(컨텍스트 버퍼, KV 캐시 위치, RoPE 오프셋에 대해 반복 간 지속적인 상태를 가질 수 있음)가 가능하기 때문에 MTP보다 더 나은 대안이 될 것입니다. 기본적으로 이는 세션이 길어지고 컨텍스트가 커질수록 DFlash가 훨씬 더 나아야 한다는 것을 의미합니다. MTP는 KV 캐시가 더 빨리 불어나기 때문에 기술적으로 성능이 더 빨리 저하될 것입니다. 하지만 저는 DFlash가 Gemma 4 26B나 Qwen 3.6 35B 같은 희소 모델에 어느 정도의 속도 차이를 가져올지 매우 궁금합니다. 안타깝게도 vLLM 전용이라 테스트를 해볼 수가 없네요. 혹시 이거 써보신 분 계신가요? 속도 면에서 유의미한 이득이 있었나요? 그리고 lcpp에서 DFlash 지원 상황은 어떤가요? 좀 가까워졌나요?


