[벤치마크] RTX 5090에서 DFlash 추측 디코딩 + KV 캐시 압축 — 3.26배 속도 향상
[Benchmark] DFlash Speculative Decoding + KV Cache Compression on RTX 5090 — 3.26x Speedup
핵심 요약
RTX 5090 환경에서 DFlash 추측 디코딩과 KV 캐시 압축을 결합해 Qwen3.6-27B 모델의 추론 속도를 3배 이상 높인 벤치마크 결과입니다.
- 성능 향상 — DFlash와 KV 캐시 압축 적용 시 최대 3.26배 속도 향상 달성
- 최적 설정 — q4_0/turbo4 조합이 속도와 품질 사이에서 가장 균형 잡힌 성능을 보임
- 코드 품질 — KV 캐시 압축 적용 시 오히려 베이스라인보다 코드 생성 품질이 개선됨
- 검증 환경 — RTX 5090 32GB VRAM 환경에서 Qwen3.6-27B 모델로 테스트 수행
하드웨어: RTX 5090 | 모델: Qwen3.6-27B | 프레임워크: BeeLlama.cpp
전체 벤치마크 스크립트, 원본 데이터, 설정 및 생성된 아티팩트는 요청 시 제공해 드립니다. DM을 보내시거나 아래에 댓글을 남겨주세요.
지난주에 Qwen3.6-27B 모델에서 KV 캐시 압축 전략과 결합된 DFlash 추측 디코딩을 벤치마킹했습니다. 결과가 꽤 놀라워서 로컬 추론을 실행하는 분들과 공유하고자 합니다.
설정
-
GPU: NVIDIA RTX 5090 (32GB VRAM)
-
모델: Qwen3.6-27B (UD-Q5_K_XL 및 NVFP4-Q8_0 두 가지 양자화)
-
드래프터(Drafter): Qwen3.6-27B-DFlash-Q5_K_M
-
프레임워크: BeeLlama.cpp (DFlash + TurboQuant/TCQ 지원)
-
PPL 데이터셋: WikiText-2
-
처리량: 커스텀 코딩 프롬프트 (코드 생성 작업)
요약
| 전략 | 속도 향상 | PPL Δ | 코드 품질 |
|---|---|---|---|
| q4_0/turbo4 | 3.18x | +0.02% | 3.0/3.0 |
| turbo4/turbo4 | 3.26x | +0.04% | 테스트됨 |
| turbo2_tcq/turbo2_tcq | 3.26x | +0.76% | 약간 하락 |
| 베이스라인 (KV 압축 없음) | 2.92x | N/A | 2.33/3.0 |
q4_0/turbo4가 가장 적절한 지점입니다: 3.18배 속도 향상에 PPL 저하는 +0.02%로, K_Q8_V_Q5_1 베이스라인과 통계적으로 차이가 없습니다.
- Q5_K_XL vs NVFP4-Q8_0: 어떤 양자화가 승자인가?
Q5_K_XL은 DFlash가 활성화되었을 때 모든 지표에서 NVFP4-Q8_0을 압도합니다:
| 양자화 | 베이스라인 tok/s | 최고 tok/s | 최대 속도 향상 |
|---|---|---|---|
| Q5_K_XL | 176.5 | 195.2 | 3.26x |
| NVFP4-Q8_0 | 157.2 | 152.6 | 2.83x |
Q5_K_XL은 베이스라인에서 더 빠를 뿐만 아니라 KV 압축 전략과 더 잘 맞습니다.


