DeepSeek-V4-Flash W4A16+FP8 및 MTP self-speculation: 2× RTX PRO 6000 Max-Q 환경에서 85 tok/s @ 524k 달성
DeepSeek-V4-Flash W4A16+FP8 with MTP self-speculation: 85 tok/s @ 524k on 2× RTX PRO 6000 Max-Q
핵심 요약
2개의 RTX PRO 6000 Max-Q에서 MTP를 활용해 DeepSeek-V4-Flash의 추론 속도를 2배 이상 향상시킨 최적화 가이드.
- 성능 최적화 — MTP 헤드 복구 및 vLLM 패치를 통해 524k 컨텍스트에서 85.52 tok/s 달성함.
- 하드웨어 이슈 — Max-Q 카드에서 발생하는 NVLink 부재 및 vLLM CustomAllreduce 데드락 문제 해결함.
- 모델 양자화 — 768개의 routed-expert 텐서를 W4A16 INT4로 GPTQ 양자화하여 효율성 극대화함.
- 실행 가이드 — 전용 vLLM 포크와 함께 제공된 AGENTS.md를 통해 자동화된 설정 및 검증 가능함.
TL;DR: DeepSeek-V4-Flash가 2× RTX PRO 6000 Max-Q 환경에서 524k 컨텍스트 기준 85.52 tok/s, 128k 단일 스트림 기준 약 111 tok/s로 구동됨.
pasta-paul의 DeepSeek-V4-Flash-W4A16-FP8 양자화 모델은 훌륭하지만, MTP 헤드가 로드 시점에 자동으로 제거됨(HF transformers가 _keys_to_ignore_on_load_unexpected에 포함시켰기 때문). 그래서 `--speculative-config '{


