4개의 RTX 2080 Ti로 DeepSeek-V4 로컬 구동하기 (2천 달러 예산, 255 prefill tok/s)
Running DeepSeek-V4 locally with 4x legacy RTX 2080 Ti ($2k budget setup). Custom Turing kernels, W8A8 quantization, and 255 prefill tok/s!
핵심 요약
2천 달러 예산의 구형 하드웨어로 DeepSeek-V4를 로컬에서 구동하는 최적화 기술을 공유함.
- 하드웨어 최적화 — 4개의 RTX 2080 Ti와 1TB RAM을 활용해 고성능 모델을 구동함.
- 커스텀 커널 — 튜링 아키텍처 전용 CUDA 커널을 작성해 대역폭 병목을 해결함.
- 추론 효율성 — W8A8 양자화와 파이프라인 전략으로 255 prefill tok/s를 달성함.
- 오픈 소스 — 구현 코드와 기술 보고서를 깃허브에 공개하여 누구나 활용 가능함.
r/DeepSeek 여러분, 안녕하세요.
H100 클러스터나 최신 고가 GPU 없이도 최첨단 MoE 모델을 돌릴 수 없다고 누가 그랬나요? 저는 소비자용 구형 하드웨어 단일 노드로 어디까지 가능한지 확인하고 싶었습니다. 그래서 총 2,500달러 미만의 예산으로 DeepSeek-V4-Flash(총 284B, 활성 13B)를 로컬에서 성공적으로 구동하는 가성비 머신을 구축했습니다!
놀랍게도 매우 빠듯한 메모리 예산으로 약 255 prefill tokens/s를 달성했습니다.
하드웨어와 소프트웨어의 공동 최적화를 통해 이 "거대한 MoE 전차를 끄는 구형 당나귀" 같은 위업을 달성한 방법을 간략히 소개합니다.
⚡️ 기술적 돌파구
- 커스텀 튜링 CUDA 커널: 2080 Ti의 텐서 코어는 여전히 쓸만하지만, PCIe Gen3와 VRAM 대역폭이 큰 병목 구간입니다. 우리는 튜링 아키텍처에 맞춰 W8A8(INT8) 행렬 곱셈을 가속하는 커스텀 CUDA 커널을 다시 작성하여 대역폭 문제를 크게 완화했습니다.
- 이종 추론: 4개의 11/22GB VRAM과 1TB 시스템 RAM 사이에서 최적화된 정적 메모리 분할 및 동적 오프로딩을 구현했습니다. 하드웨어 용량을 100% 활용합니다.
- 연산-통신 오버랩: MoE 라우팅으로 인해 발생하는 막대한 멀티 GPU 통신 오버헤드를 숨기기 위해 파이프라인 실행 전략을 구현했습니다.
🖥️ 가성비 하드웨어 사양
- CPU: Intel Xeon E5-2696 v4 (멀티코어 가성비의 고전)
- GPU: 4x RTX 2080 Ti (각 11/22GB)
- RAM: 1TB DDR4 ECC
전체 구현 내용, 배포 스크립트, 예비 기술 보고서는 100% 오픈 소스로 공개되어 있습니다. 시스템/컴파일러 해커분들의 생각이나 벤치마크, 피드백을 듣고 싶습니다!
🔗 GitHub 저장소: https://github.com/lvyufeng/deepseek-v4-2080ti

