집에서 (더 빠르게) DeepSeek V4 Pro 돌리는 중
I have (even faster) DeepSeek V4 Pro at home
핵심 요약
Epyc 서버와 RTX PRO 6000을 활용해 로컬에서 DeepSeek V4 Pro를 구동하고 성능을 벤치마크함.
- 하드웨어 구성 — Epyc 9374F와 RTX PRO 6000 Max-Q를 사용하여 로컬 환경을 구축함.
- 성능 벤치마크 — ktransformers를 활용해 64k 컨텍스트까지 단계별로 추론 속도를 측정함.
- 최적화 시도 — NUMA 설정과 코어 튜닝을 통해 하드웨어 성능을 극대화함.
- 기술적 한계 — 64k 테스트 시 타임아웃 문제와 웜업 단계의 동작 방식을 확인함.
며칠 전, 제가 집에서 돌리는 DeepSeek V4 Pro에 대해 글을 올렸는데, 이제 업데이트할 시간이 되었네요. 어제 드디어 ktransformers (sglang + kt-kernel)에서 이 모델을 구동하는 데 성공했습니다. DeepSeek V4 Flash를 위한 튜토리얼을 따라 했고, 제 하드웨어(Epyc 9374F + RTX PRO 6000 Max-Q)에 맞춰 몇 가지 옵션(NUMA, 코어)을 조정했습니다. 그 후 llama-benchy를 실행하여 컨텍스트 깊이를 늘려가며 성능을 확인했습니다. 결과는 다음과 같습니다.
Depth 0:
| model | test | t/s | peak t/s | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|:----------------------------|-------:|-------------:|------------:|----------------:|----------------:|----------------:|
| deepseek-ai/DeepSeek-V4-Pro | pp512 | 39.76 ± 0.00 | | 12878.44 ± 0.00 | 12877.59 ± 0.00 | 12878.44 ± 0.00 |
| deepseek-ai/DeepSeek-V4-Pro | tg32 | 7.54 ± 0.00 | 8.00 ± 0.00 | | | |
Depth 2048:
| model | test | t/s | peak t/s | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|:----------------------------|--------------:|-------------:|------------:|----------------:|----------------:|----------------:|
| deepseek-ai/DeepSeek-V4-Pro | pp512 @ d2048 | 45.13 ± 0.00 | | 56726.85 ± 0.00 | 56725.93 ± 0.00 | 56726.85 ± 0.00 |
| deepseek-ai/DeepSeek-V4-Pro | tg32 @ d2048 | 7.32 ± 0.00 | 8.00 ± 0.00 | | | |
Depth 4096:
| model | test | t/s | peak t/s | ttfr (ms) | est_ppt (ms) | e2e_ttft (ms) |
|:----------------------------|--------------:|-------------:|------------:|-----------------:|-----------------:|-----------------:|
| deepseek-ai/DeepSeek-V4-Pro | pp512 @ d4096 | 45.75 ± 0.00 | | 100729.28 ± 0.00 | 100728.46 ± 0.00 | 100729.28 ± 0.00 |
| deepseek-ai/DeepSeek-V4-Pro | tg32 @ d4096 | 7.29 ± 0.00 | 8.00 ± 0.00 | | | |

