Kimi-k3를 구동해 봤다...
I got Kimi-k3 running.....
핵심 요약
고성능 워크스테이션 환경에서 Kimi-k3 모델을 구동하고 성능을 테스트한 기록입니다.
- 모델 구동 환경 — 9965WX CPU와 RTX 6000 PRO 2개, NVMe RAID를 활용한 고사양 워크스테이션 구성함
- 성능 결과 — 440토큰 생성에 약 31분이 소요되는 매우 느린 추론 속도를 기록함
- 기술적 시도 — llama.cpp PR을 활용해 GGUF 변환 및 구동에 성공함
- 향후 계획 — NVMe 슬롯을 추가로 채워 대역폭을 높이고 RPC 서버를 통한 클러스터 연결을 시도할 예정임
결과:
prompt eval: 40 tokens / 97.5s → 0.41 tok/s
eval: 400 tokens / 1769.9s → 0.23 tok/s
total: 440 tokens / 1867s (31 min)
프롬프트:
"Write a C++ function that reverses a linked list in place. Explain the pointer manipulation."
구동 방식:
- llama.cpp GitHub의 PR#26185 사용
- GGUF 변환에도 동일한 PR 사용
하드웨어:
- 9965WX PRO 512 GB DDR5 6400
- RTX 6000 PRO 96GB x2
- PCIE Gen 5 Raid NVME Raid 카드
- 2x 4TB 9100 Pros (Raid 0 구성, 약 29 GB/s)
실행 정보:
# 다른 파라미터는 기본값, mmap은 켜짐(기본값)
CUDA_VISIBLE_DEVICES=0,1 llama-server \
-m k3-00001-of-00033.gguf \
--n-cpu-moe 93 -ngl 99 -c 8192 -fa on --jinja
다음 단계: RPC 서버를 사용하여 2x 25GbE로 워크스테이션을 100GbE 패브릭(4xSpark 클러스터)에 연결할 예정.
업데이트:
버그로 보이는 현상 발견. Unsloth 팀(디스코드)에 해당 버그를 겪은 적 있는지 문의 중. PR 댓글로 버그 리포트함.


