Kimi K3 로컬 환경에서 처음 돌려본 후기
My first run of Kimi K3 locally.
핵심 요약
llama.cpp의 RPC 기능을 활용해 여러 클러스터에서 Kimi K3 모델을 로컬로 구동한 경험과 향후 최적화 계획을 공유함.
- RPC 활용 — llama.cpp를 통해 여러 시스템의 GPU를 연결하여 모델 구동함
- 메모리 부족 — 현재 클러스터 용량 문제로 일부 오프로딩이 발생함
- 성능 최적화 — 향후 단일 시스템으로 통합하여 2~3배 속도 향상을 목표로 함
- 모델 전략 — Kimi K3를 계획용으로 사용하고 DeepSeek 및 Qwen 모델에 작업을 분배할 계획임
llama.cpp의 RPC를 사용해서 2개의 클러스터에 걸쳐 구동 중임.
두 클러스터 모두 메모리에 전체를 올리기엔 부족해서, 메인 클러스터가 여전히 일부 오프로딩을 하면서 돌아가는 중임. 목표는 모든 GPU를 하나의 시스템에 몰아넣는 거고, RPC 없이 돌리면 아마 2~3배는 더 빨라질 듯. 지금은 IQ1_M으로 돌리고 있는데, Q2_K_XL까지 올리는 게 목표임. Qwen3.8이 이만큼 좋으면서 더 빠르고 가볍길 바라고 있고, DeepSeekV4Pro나 GLM5.3도 같은 크기에 비슷한 성능이길 기대함. 결과물 퀄리티를 보려고 어려운 코딩 문제를 던져볼 생각인데, 기본 아이디어는 이 모델로 계획을 짜고(PLAN) 실제 작업은 DeepSeekV4Flash나 Qwen3.7-27B에 맡기는 방식임.
뜻이 있는 곳에 길이 있는 법. 로컬 LLM을 절대 포기하지 마! "가성비" 빌드 만세.


