10~12개의 RTX 3090에서 구동하는 DeepSeek-V4-Flash-Vision-Exp (285B MoE) — spec decoding 및 vision 지원
DeepSeek-V4-Flash-Vision-Exp (285B MoE) on 10-12x RTX 3090 — spec decoding, vision
핵심 요약
10~12개의 RTX 3090 GPU를 활용해 285B 파라미터 모델인 DeepSeek-V4-Flash-Vision-Exp를 구동하고 최적화한 사례 공유.
- 성능 최적화 — 10~12개의 RTX 3090으로 60~120 tok/s의 decode 속도 달성
- 기술 스택 — vLLM 기반의 SM86 호환 빌드와 DSpark spec decoding 적용
- 기능 지원 — vision, spec decoding, tool calling 및 최대 4M 컨텍스트 지원
- 재현 가능성 — 도커 이미지와 빌드 가이드, 런타임 패치 제공
소비자용 Ampere GPU인 RTX 3090 10~12개, SM86 호환 vLLM 빌드에서 deepseek-ai/DeepSeek-V4-Flash-Vision-Exp 전체 모델을 돌려봤다.
285B MoE, FP4 전문가 모델 + FP8 어텐션, 가중치 용량은 157GB다.
주요 특징:
-
60+ tok/s 디코드, DSpark spec (k=3) 적용
GPU 10개(TP2xPP5) 사용, 전력 제한 240W 기준 -
120+ tok/s (GPU 12개, TP4xPP3 사용 시)
-
비전 + spec + 툴 콜 전부 정상 작동
-
1M 컨텍스트 (오프로드 없음) / 4M (RAM 오프로드 사용 시)
-
긴 컨텍스트 프리필 속도 약 3,500 tok/s
문서화 및 재현 가능하게 다 정리해둠:
- 빌드 완료된 이미지:
docker pull ghcr.io/ciprianveg/3090-vllm:dsv4-flash-vision-sm86
(빌드 가이드, 시작 스크립트, 런타임 패치 포함)
패치에는 DSpark propose-gate (spec + 비전 수정), 스케줄러 mm x spec 행 교차, 문법 비트마스크 검증, 비전 ViT OOM 수정, FlashInfer 워크스페이스 레인 키잉 등이 포함되어 있다.
