Qwen 3.8 27B 모델 속도를 최대 4배 높여주는 DFlash2
DFlash2 speeds Qwen 3.8 27B up to 4 times
핵심 요약
llama.cpp에 추가된 DFlash2가 Qwen 27B 모델의 추론 속도를 크게 향상시켰으나, VRAM 소모와 실사용 성능에 대한 의문이 제기되었습니다.
- DFlash2 성능 — Qwen 27B 모델에서 평균 3배의 추론 속도 향상 기록함
- VRAM 소모 — 드래프터 모델 사용으로 인해 추가적인 VRAM 점유가 발생함
- 실사용 효율 — MTP 대비 실질적인 이득이 적거나 상황에 따라 성능이 떨어지기도 함
- 하드웨어 호환성 — Apple Silicon 및 고사양 GPU 환경에서 MTP 대비 큰 차이를 보이지 않음
llama.cpp pr #27342에서 dflash2를 추가했길래, RTX 6000 하나 빌려서 qwen3.8 27B 모델로 디코딩 설정 4개 돌려봤다.
4개 작업에 대한 중앙값 결과는 다음과 같음:
- baseline 47.4 tok/s
- mtp 114.7 tok/s
- dflash 99.3 tok/s
- dflash2 140.6. tok/s
결론적으로 dflash2가 평균 3배 정도 빠름.
물론 항상 3배씩 뻥튀기되는 건 절대 아님. 테스트 하나는 1.5배도 겨우 넘기는 수준이었으니까, 결국 모델한테 어떤 작업을 시키느냐에 따라 갈리는 듯.
영상 중간중간 속도를 좀 높여서 전체 길이를 30초 정도로 맞췄는데, 화면에 나오는 tok/s랑 수락률(acceptance %)은 실제 수치임.
난 atomic.chat 팀 소속이고, 허깅페이스에 직접 퀀트 모델 올리고 로컬 모델 돌리는 데스크톱/모바일 앱도 만들고 있음. 피드백은 언제든 환영이다. 너네들 쓰라고 만드는 거니까.
dflash2 관련 정보: https://inco.ai/blog/dflash2/

