B300 8대로 Kimi K3(2.8T 파라미터) 호스팅해봄. 92 tok/s, 100만 토큰당 190달러
I hosted Kimi K3 (2.8T parameters) using 8 B300s. 92 tok/s, $190 per million tokens
핵심 요약
2.8T 규모의 Kimi K3 모델을 B300 8대로 호스팅한 실험 결과와 비용 효율성에 대한 분석입니다.
- 호스팅 실험 — B300 8대와 vLLM을 사용하여 92 tok/s의 성능을 기록함
- 비용 분석 — 단일 스트림 기준 100만 토큰당 190달러의 비용이 발생함
- 양자화 비교 — 1비트 GGUF 양자화 모델은 성능은 유지되나 토큰당 비용 효율이 낮음
- 향후 계획 — 단일 스트림의 한계를 극복하기 위해 병렬 서빙으로 전환할 예정임
내가 돌려본 환경:
-
Modal에서 8x B300, 시간당 $56.79, vLLM, 텐서 병렬 8, 네이티브 MXFP4 사용
-
콜드 부팅 약 27분 (1.56 TB 로드, JIT, CUDA 그래프 캡처 5개)
-
TTFT 0.92~1.02초, 디코드 92 tok/s 유지, 프롬프트 4개 평균 83 tok/s
-
출력 토큰 백만 개당 $190. 깔끔하게 한 번 돌리는 데 GPU 비용만 약 $36 깨짐. 켜두기만 하면 하루에 $1,363 나감.
Unsloth의 Dynamic GGUF도 돌려봤음.
이놈들 1비트 UD-IQ1_S (594 GB)는 llama.cpp로 8x A100-80GB에 딱 들어감.
시간당 $19.99로 2.8배 더 쌈. 결과는? 약 9 tok/s, TTFT 7~60초, 토큰 백만 개당 약 $620로 토큰당 비용은 3.3배 더 비쌈.
1비트인데도 퀄리티는 괜찮았음 (산수 잘하고 문맥도 자연스러움).
모든 플래그, Modal 배포 파일, 원본 벤치마크 JSON이 포함된 전체 글은 여기서 확인 가능: https://books.vizuara.ai/book/kimi-k3-hosting

