Kimi K3 풀 모델, 16x GB10 클러스터에서 20+ tps로 구동
Kimi K3 full model running on 16x GB10 cluster at 20+tps
핵심 요약
16개의 GB10 클러스터로 Kimi K3 풀 모델을 구동하여 평균 20+ tps 성능을 달성했습니다.
- 성능 지표 — 평균 20+ tps, 최대 38 tps 및 750 tps prefill 속도 기록함
- 하드웨어 구성 — 16개의 GB10 클러스터와 dspark를 활용하여 구동함
- 향후 계획 — 최적화 테스트 후 vllm 이미지와 가이드 공개 예정임
Kimi K3 풀 모델이 16x GB10 클러스터에서 평균 20+ tps(llama-benchy coherent corpus 기준), 최대 38 tps, 750 tps prefill로 구동 중입니다. 제 클러스터에서 dspark를 사용해 k3 풀 모델을 돌린 첫 번째 사례입니다. 몇 가지 테스트를 거쳐 속도를 더 높여볼 생각입니다. 준비가 되는 대로 vllm 이미지와 지침을 공개하겠습니다.
https://forums.developer.nvidia.com/t/full-kimi-k3-running-on-16x-gb10-cluster/379174

