듀얼 DGX Spark로 DeepSeek V4 Flash 구동: 40tk/s (1M 컨텍스트) 및 350tk/s (집계) 성능
Dual DGX Sparks- 40tk/s single 1M ; 350 tk/s agg. - Deepseek V4 Flash (vs RTX Pro 6000 vs Mac M2 Ultra 192)
핵심 요약
듀얼 DGX Spark를 활용해 대규모 MoE 모델을 효율적으로 구동하는 설정과 벤치마크 결과를 공유합니다.
- 성능 최적화 — 듀얼 DGX Spark와 200G/s 케이블을 통해 40tk/s의 속도 달성
- 벤치마크 비교 — RTX Pro 6000 및 Mac M2 Ultra 192GB 대비 우수한 FP8 성능 확인
- 대규모 컨텍스트 — 32개 요청 동시 처리 시 최대 350tk/s의 집계 속도 기록
- 기술 공유 — Nvidia 커뮤니티와 Antirez의 연구를 바탕으로 한 설정 레시피 제공
우선 Aiden/Antirez와 Nvidia 커뮤니티 스레드의 천재들에게 감사를 표합니다. 저는 그저 그들의 작업물에서 Claude와 함께 영감을 얻었을 뿐입니다.
그렇긴 하지만, 에이전트 용도로 대규모 MOE 모델을 합리적인 속도로 구동하기 위해 두 대의 DGX Spark를 사용하는 레시피와 학습 내용, 벤치마크를 공유하고자 합니다:
https://github.com/elsung/dgx-spark-deepseek-v4-flash
여기서 핵심은 우리가 필요한 속도를 얻으려면 2대의 DGX Spark가 필요하다는 점이며, 이 속도를 내기 위해 ConnectX-7을 통한 200G/s 연결용 케이블에 180달러를 투자해야 한다는 것입니다.
하지만, 최첨단 모델들과 어깨를 나란히 하는 모델을 ~40tk/s로 구동할 수 있다는 것은 매우 흥미로운 일이며, 저와 다른 많은 이들이 오랫동안 꿈꿔왔던 일이기도 합니다.
또한 RTX Pro 6000 및 Mac M2 Ultra 192GB와 비교한 벤치마크도 포함했습니다.
세 줄 요약:
- 듀얼 DGX - FP8 ~40 tk/s
- 싱글 DGX - FP8 ~14 tk/s
- RTX Pro 6000 - Q2 ~46 tk/s
- M2 Ultra 192GB - Q2 ~29 tk/s
2x DGX가 승리한 이유는 FP8을 사용하고 빠르며 동시 실행이 가능하기 때문입니다.
각각 256k 컨텍스트를 가진 32개의 요청을 실행할 때 최대 350 tk/s의 집계 속도를 냅니다.
다른 분들에게도 유용했으면 좋겠네요~
출처 링크 / 스레드 (진행 중인 토론)
-
Antirez와 그의 멋진 작업
-
Aiden 스레드 및 Nvidia 커뮤니티 스레드에서 찾은 DGX 스레드:


