홈랩에서 돌려본 Kimi K3 첫 결과: 초당 4토큰
First Kimi K3 results on home lab ~ 4t/s
핵심 요약
DDR5 768GB와 RTX 5090 2개를 활용해 Kimi K3 모델을 구동한 결과와 성능에 대한 공유입니다.
- 하드웨어 사양 — DDR5 768GB RAM과 RTX 5090 2개를 사용함
- 성능 결과 — 초당 4토큰의 디코딩 속도와 50~70토큰의 프리필 속도를 기록함
- 최적화 가능성 — 이더넷 병목 현상을 해결하면 초당 8토큰까지 성능 향상을 기대함
- 하드웨어 발열 — 고사양 장비 구동으로 인한 PSU 발열 문제가 언급됨
DDR5 768GB와 5090 2개를 사용한 것치고는 예상보다 좋은 결과가 나왔어.
https://github.com/pwilkin/llama.cpp/tree/kimi-k3-text 포크와 https://huggingface.co/GrEarl/Kimi-K3-GGUF Q2_K 퀀트 모델을 사용했어.
큰 프롬프트에 대한 프리필 속도는 초당 50~70토큰이야.
가장 재밌는 건 디코딩 속도가 시간이 지날수록 빨라진다는 거야. 아마 웜업이나 스왑 관련 문제인 것 같아. Llama-bench가 자꾸 튕겨서 공유를 못 하겠네.


