미친 수준의 RTX 5090 80개로 구축한 로컬 Kimi K3 셋업
The insane 80x RTX 5090 local Kimi K3 setup
핵심 요약
RTX 5090 80개를 활용한 Kimi K3 로컬 구축 사례와 그 효율성 및 기술적 한계에 대한 분석입니다.
- Kimi K3 셋업 — RTX 5090 80개를 활용한 2.8조 파라미터 모델 구동
- 성능 및 제약 — 25GbE 네트워크와 GDDR7 사용으로 인한 병목 현상 발생
- 경제적 타당성 — 전력 소모 문제와 인프라 구축 비용에 대한 논의
- 미래 전망 — 로컬 모델 구동의 현실화와 데이터센터 장비 시장 변화 기대
Ning 팀의 셋업 보셨나요?
그들은 80개의 RTX 5090으로 Kimi K3를 배포했습니다. 현재 FP4로만 실행 중인데, 아마 NVIDIA의 NVFP4 버전을 기다리면 정확도 손실을 훨씬 줄일 수 있을 겁니다.
Kimi K3는 2.8조 개의 파라미터를 가지고 있으며, 이 셋업은 노드당 8개의 카드가 들어가는 10개의 노드를 사용하여 총 2.56TB의 VRAM을 확보했습니다. HBM도, NVLink도, InfiniBand도 없이 오직 5090의 GDDR7과 일반적인 25GbE 네트워크만 사용했습니다.
단일 스트림 추론에서 초당 약 20 토큰(tok/s)을 얻었고 아직 제대로 최적화하지도 않았다고 합니다. 그들 말로는 첫 GLM 배포 때도 30 토큰 정도였는데 지금은 110까지 올렸다고 하네요.
솔직히 5090을 사용하는 건 어느 정도 홍보용 쇼라고 생각합니다. B300을 구할 수 없더라도 H100으로도 충분히 배포할 수 있었을 테니까요. 하지만 지금 돌아가는 상황을 보면, 이런 모델들을 로컬에서 돌리는 게 1~2년 내에 완전히 현실화될 것 같습니다. 소규모 팀 몇 명만으로도 지금 우리가 가진 모델들을 엄청난 비용을 들이지 않고 배포할 수 있게 되겠죠. 저는 여전히 구형 데이터센터 카드들이 중고 시장에 풀리기를 기다리고 있습니다... H100 가격이 V100 수준으로 떨어진다면 정말 좋을 텐데 말이죠.


