16x GB10 클러스터에서 Kimi K3(2.8T) 가속 — 코딩 처리량 30 t/s, 동시성 피크 136 t/s
Speed-up Kimi K3(2.8T) on a 16x GB10 Cluster — 30 t/s coding throughput, 136 t/s concurrency peak.
핵심 요약
16x GB10 클러스터를 활용해 2.8T 파라미터 모델인 Kimi K3를 구동하고 최적화한 사례 공유.
- 성능 최적화 — 커스텀 런타임 패치와 네트워크 설정을 통해 30 t/s의 코딩 처리량 달성
- 하드웨어 구성 — 16개의 GB10 노드와 400G/100G 네트워크 스위치로 클러스터 구축
- 모델 구동 — 2.8T 파라미터의 Kimi K3 모델을 안정적으로 실행하고 동시 요청 처리
- 오픈 소스 공유 — 런타임 패치, 설정 파일 및 빌드 스크립트를 GitHub에 공개

16x GB10 클러스터에서 Moonshot AI의 Kimi K3(moonshotai/Kimi-K3) 풀 모델을 돌려본 후기랑 성능 영상 공유한다.
2.8T 파라미터짜리 모델을 매끄럽게 돌리려면 커스텀 런타임 패치랑 탄탄한 네트워크 구성이 필수인데, 코딩 작업할 때 처리량(throughput)이랑 동시성(concurrency)은 진짜 지리더라.
성능 벤치마크
코딩 생성 / 디코드: 빡센 코드 생성이나 에이전트 작업 돌릴 때 30 tok/s 정도 유지되고, 피크 찍으면 38 tok/s까지 나옴.
프리필 처리량: 750–910 tok/s (수정된 NCCL 토폴로지랑 듀얼 스위치 셋업으로 최적화함).
동시성 & 스트레스 테스트: 토큰 생성 속도 저하나 KV 캐시 메모리 부족 현상 없이 여러 사용자 요청을 동시에 매끄럽게 처리함.
컨텍스트 / 툴 벤치: 수십만 토큰 컨텍스트도 안정적으로 돌아가고, 500k 압축(compaction) 여러 번 거치는 에이전트 워크플로우도 문제없음.
컴퓨트: 16x GB10 클러스터 노드
연결: 4x 400G-to-4x100G 브레이크아웃 케이블을 사용한 듀얼 MikroTik 스위치 (CRS804-4DDQ).
런타임: 커스텀 MLA/KV 커널이 포함된 dspark / Inferact/Kimi-K3-DSpark 래퍼를 사용한 커스텀 gb10-vllm 스택.
실시간 토큰 스트리밍이랑 코딩 출력 보여주는 짧은 영상 첨부했다.
GitHub & 셋업 파일:
모든 런타임 패치, 설정 파일, 빌드 스크립트는 내 GitHub에 다 올려놨음:


