DeepSeek V4-Flash (284B MoE) 2x RTX 3090 + 중고 쿼드 제온 DDR4 서버에서 33 tok/s(단일) / 68 tok/s(합산) 달성 — 전체 구성
DeepSeek V4-Flash (284B MoE) at 33 tok/s single / 68 tok/s aggregate on 2× RTX 3090 + a used quad-Xeon DDR4 server — full config
핵심 요약
중고 서버 하드웨어를 활용해 156GB 규모의 DeepSeek V4-Flash 모델을 구동하고 성능을 최적화한 사례입니다.
- 하드웨어 구성 — 2x RTX 3090 및 4소켓 제온 서버를 활용하여 전체 체크포인트 로드
- 병목 현상 — CPU 측 DRAM 대역폭이 성능을 제한하는 핵심 요소로 확인됨
- 성능 결과 — 단일 스트림 33 tok/s, 합산 68 tok/s로 효율적인 추론 달성
- 최적화 팁 — vLLM 포크와 Marlin 커널을 통해 Ampere 아키텍처에서 고성능 구현
DeepSeek V4-Flash-0731을 돌려봤다. 재양자화(re-quant)가 아니라 공식 체크포인트 그대로, 중고 하드웨어에서 돌린 거다. 이 엔진으로 Ampere 아키텍처 결과 뽑아낸 놈이 아무도 없길래 공유한다.
2018년형 서버를 왜 쓰냐고?
이 모델은 156 GB다. 속도 따지기 전에 이 용량이 모든 걸 결정한다:
| Platform | Memory | Bandwidth | Price | Runs DS4-Flash? |
|---|---|---|---|---|
| Mac Studio M3 Ultra | 96 GB max¹ | 819 GB/s | $3,999+ | ❌ won't load |
| DGX Spark | 128 GB | 273 GB/s | $4,699² | ⚠️ 4-bit re-quant only, ~10 GB headroom |
| AMD Ryzen AI Halo | 128 GB | ~256 GB/s | $3,999 | ⚠️ same |
| RTX PRO 6000 Blackwell | 96 GB | 1,792 GB/s | ~$9,000 | ❌ won't load |
| 6× RTX 3090 | 144 GB | 936 GB/s | ~$6,600 cards alone | ✅ (+ a chassis that takes 6 cards) |
