오늘 Kimi K3 가중치 공개. 이번 주에 A100, H200, B300에 배포할 예정인데 A100은 벌써 계산이 빡빡하네
Kimi K3 weights drop today. We're deploying on A100s, H200s and B300s this week and the A100 math is already rough
핵심 요약
Kimi K3 모델 가중치 공개에 맞춰 A100, H200, B300 GPU 클러스터에서의 배포 및 벤치마크 계획 공유.
- 모델 사양 — 2.8조 파라미터, MoE 구조, 1M 컨텍스트 및 비전 지원.
- 메모리 제약 — 1.4TB에 달하는 가중치로 인해 A100 및 H200 단일 노드 배포 불가.
- B300 활용 — Blackwell 아키텍처의 FP4 지원으로 단일 노드 구동 가능.
- 벤치마크 계획 — 이번 주 내로 GPU 구성별 성능 및 비용 데이터 공개 예정.
세 줄 요약: K3를 A100(진짜 돌아가는지 함 보자), H200, B300에서 돌릴 거임. A100이랑 H200 결과는 이번 주에 나오고, B300 클러스터는 주말에 세팅해서 다음 주쯤 결과 나올 듯.
가중치는 오늘 Hugging Face에 올라올 예정임(Moonshot이 7월 27일로 약속함). 플랫폼 문서에서 확인한 스펙은 대충 이럼: 총 파라미터 2.8t, MoE 방식에 전문가 896개, 토큰당 16개 활성화, 1M 컨텍스트, 비전 기능 탑재. MXFP4로 양자화 인식 학습을 해서 다운로드 용량은 1.4TB 정도 될 듯. 다들 가중치 받으려고 대기 중일 테니 우리가 미리 계산해 본 메모리 요구 사항 공유함.
우리가 A100 80GB, H200, B300 장비를 다 가지고 있어서 전부 다 돌려볼 계획이었거든? 근데 막상 메모리 계산을 해보니까 답이 안 나오더라.
A100 8x 구성하면 640GB인데, 가중치만 1.4TB임. KV 캐시 할당하기도 전에 노드 3개가 필요하다는 소리임. 게다가 Ampere 아키텍처는 FP4나 FP8 텐서 코어가 없어서, 디양자화를 하든가 이번 릴리즈 타겟도 아닌 INT4 커널을 돌려야 함. 그래도 누군가는 실측 데이터를 뽑아야 하니까 벤치마크는 돌릴 건데, 결과는 처참할 걸로 예상됨.
H200 8x는 1.13TB 정도라 이것도 한 노드에 안 들어감. 최소 2노드 구성해야 해서 토큰마다 인터커넥트 비용 오지게 깨질 거임.
B300 8x는 2.3TB 정도라 유일하게 한 노드에 다 들어가고 긴 컨텍스트용 KV 캐시까지 여유가 좀 있음. Blackwell은 FP4를 네이티브로 지원하니까 Moonshot이 딱 이걸 노리고 양자화한 게 확실함. B300은 이번 주말에 가동될 예정이고, 다들 하드웨어 선점한다고 난리인데 정작 조건도 모르고 달려드는 중임. Moonshot 모델 카드도 특이하게 단점을 솔직하게 적어놨더라: 에이전트가 사고 과정을 잘라먹으면 성능 떡락하고, 애매한 상황에서 질문하기보다 일단 저지르고 보며, 벤치마크 점수는 비슷해도 실제 채팅 경험은 Fable 5나 Sol보다 떨어진다고 인정함.
이번 주말까지 세 GPU 구성에 대한 tok/s, ttft, 1M 토큰당 비용 데이터 다 뽑을 거임. 테스트 매트릭스에 넣었으면 하는 배치 사이즈나 컨텍스트 길이, 병렬 처리 설정 있으면 댓글 달아줘. 추가해 줄게.
