Gemma 4 MTP와 DFlash의 H100 1대 성능 비교: Dense vs MoE 결과
Gemma 4 MTP vs DFlash on 1x H100: dense vs MoE results
핵심 요약
H100 환경에서 Gemma 4 모델의 MTP와 DFlash 추론 성능을 벤치마크한 결과, 모델 구조에 따라 성능 우위가 갈림.
- 성능 비교 — H100 1대에서 vLLM을 사용하여 Gemma 4의 MTP와 DFlash 추론 속도를 측정함.
- 모델별 결과 — Dense 모델은 MTP가, MoE 모델은 DFlash가 더 높은 처리량을 보임.
- 작업 특성 — 코딩, 수학 등 예측 가능한 작업에서 추론 가속 효과가 더 크게 나타남.
- 추론 방식 — MTP는 토큰 단위, DFlash는 블록 단위로 생성하여 처리 방식에 따른 성능 차이가 발생함.
Gemma 4 MTP와 z-lab의 DFlash를 vLLM과 NVIDIA의 SPEED-Bench 정성 데이터셋을 사용하여 H100 80GB 1대에서 벤치마크했습니다.
Setup:
- 하드웨어: 1x H100 80GB
- 런타임: vLLM
- 데이터셋: SPEED-Bench 정성 데이터셋
- 프롬프트: 총 880개, 11개 카테고리별로 80개씩
- 모델: google/gemma-4-31B-it 및 google/gemma-4-26B-A4B-it
- MTP 드래프트: Google의 매칭 Gemma 4 어시스턴트 모델
- DFlash 드래프트: z-lab의 매칭 Gemma 4 DFlash 모델
- MTP 설정:
num_speculative_tokens=8 - DFlash 설정:
num_speculative_tokens=15 - 컨텍스트 길이 / 최대 모델 길이:
32768 - 온도(Temperature): 0
- 프리픽스 캐싱 비활성화
Results:
- Gemma 4 31B dense 모델의 경우, 동시성 1에서 MTP가 3.11배, DFlash가 3.03배 더 빨랐습니다. 베이스라인은 40.3 출력 토큰/초, MTP는 125.3 출력 토큰/초, DFlash는 122.1 출력 토큰/초를 기록했습니다. 동시성 16에서 베이스라인은 375 토큰/초, MTP는 953 토큰/초, DFlash는 725 토큰/초를 기록했습니다.


