“올 스파크(All Spark)” 클러스터: DGX Spark 16개에서 36개로 업그레이드
“The All Spark” Cluster: Upgrading from 16 - 36 DGX Sparks
핵심 요약
홈랩에 DGX Spark 36개를 구축하여 4.6TB 통합 메모리를 확보한 괴물 같은 AI 클러스터 구축기입니다.
- 클러스터 확장 — DGX Spark 16개에서 36개로 증설하여 4.6TB 통합 메모리 확보함
- 에이전트 시스템 — Hermes와 커스텀 메모리 사이드카를 결합해 단일 에이전트 클러스터로 운용함
- 하드웨어 전략 — B200/B300 대신 Spark와 6000 Pro를 선택해 전력 및 냉각 효율과 유연성을 확보함
- 운영 목적 — SOTA 모델 추론과 임베딩, 영상/오디오 생성 작업을 동시에 처리하기 위함
올해 초에 내가 아마 세계 최초일 16x DGX Spark 클러스터 구축했다고 글 올렸었지.
이제 홈랩 서버 랙에 Spark 20대를 더 추가해서 통합 메모리 4.6TB를 찍었다.
• 36x Sparks
• 1x 200Gbps FS 24 x 200Gb QSFP56 + 8x 400Gb Switch
• 24x QSFP56 DAC cables
• 6x 400gb to 2x 200gb breakout cables
지난 4개월 넘게 새로 나온 굵직한 모델들은 거의 다 돌려봤다. 근데 이 클러스터를 단순히 추론용으로만 쓰는 게 아님. 클러스터를 쪼개서 "추론 모듈"들을 배치하고, Hermes랑 내가 직접 만든 커스텀 메모리 사이드카 시스템을 조합해서 하나의 지속적인 에이전트로 관리 중이다. 그냥 덩치 큰 추론 머신이라기보단 에이전트 역량 클러스터가 됐다고 보면 됨.
지금 클러스터를 36대로 늘리는 이유는 Kimi K3 같은 SOTA 모델 전용으로 노드 16개를 박아두고도, 리랭크/임베딩 작업, 영상 생성, 이미지 생성, 오디오 처리 같은 걸 동시에 다 돌릴 수 있는 여유분을 확보하고 싶어서다.
아니, 왜 6000 Pro나 B200, 아니면 B300 같은 거 안 사고 이러냐고 물어볼 수도 있는데, 이유는 몇 가지 있다.
-
이 서버 랙에 6000 Pro 시스템도 2대(4x Max Q 저전력 빌드 + 8x 엔터프라이즈 서버) 들어갈 예정이라, 올해 초에 쓰던 H100이랑 GH200은 이걸로 대체함.
-
B200/B300은 지금 이 미친 수준의 홈랩 환경에서도 냉각이랑 전력 문제가 너무 심각함. 그리고 이번 빌드의 핵심은 데이터센터나 외부 스토리지 의존 없이 완전히 독자적인 환경을 구축하는 거거든.
-
내 생각에 확장 가능한 통합 메모리 가성비로는 Spark가 여전히 최고임. 나중에 M5 Ultra 나오면 Mac Studio 추가해서 분산 추론 쪽 파보는 게 엄청난 이득일 거라 본다.
-
Spark랑 6000 Pro 조합이 구성이나 전력 최적화 면에서 유연성이 개쩔고, 나중에 다 처분하고 새 걸로 갈아탈 때도 현금화하기가 훨씬 수월함.

