Kimi K3 (Unsloth) IQ2-XXS 모델, 711GB에서 478GB로 용량 대폭 축소!!! 다국어 데이터만 제거해 크기 최적화
Kimi K3 (Unsloth) IQ2-XXS from 711GB down to 478GB!!! Only Multi-language was removed to trim the size
핵심 요약
다국어 데이터를 제거해 모델 크기를 획기적으로 줄인 Kimi K3 모델에 대한 기술적 논쟁과 실험 결과 공유.
- 모델 최적화 — 다국어 데이터를 제거하여 711GB 모델을 478GB로 경량화함
- 기술적 논쟁 — LLM의 언어별 가중치 분리 가능 여부를 두고 전문가들 간 의견 대립
- 실험 결과 — SWE-Lancer 작업 수행 시 특정 환경에서 성능 차이 발생
- 향후 과제 — VRAM 환경에서의 정확한 성능 비교 및 추가 검증 필요
일단 "hellohazine" 님한테 진짜 고맙다는 말부터 해야겠네. 이 양반이 모델에서 다국어 관련 군더더기 싹 다 쳐내고 영어만 남겨놨거든. 모델 본체는 그대로라 지능은 여전히 쌩쌩함.
진짜 천재적인 접근 방식이라고 본다. 앞으로 새 모델 나올 때마다 이런 식으로 용량 줄이는 시도 많이 했으면 좋겠음. 다음 주에 3.8 Qwen MAX 나올 사람?
DeepSeek V4 Flash 같은 모델들도 이런 식으로 얼마나 쳐낼 수 있을지 생각 좀 해봐라.
Kimi K3 링크: https://huggingface.co/hellohazime/Kimi-K3-REAP-512GB-GGUF
수정: 아래는 모델 에디터가 남긴 현재 메모임.
"테스트는 SWE-Lancer의 'task selection'이랑 'per-task' 옵션 써서 돌려보는 중임.
이 Kimi-K3-REAP-512GB-GGUF 2비트 모델이 Kimi K2.7 (2비트)보다 정확도 높은 건 거의 확실함.
내 맥 램 용량으로는 감당이 안 돼서, SSD에서 'expert' 모델을 실시간으로 불러오는 패치(llama.cpp의 MoE 스트리밍) 강제로 적용해서 SWE-Lancer 작업 3개(14294 / 15815_1 / 15925)를 돌려봤거든. 근데 결과는 완전히 개박살 났음.
근데 같은 가중치에서 내가 따로 떼어낸 reap576_iq2xxs (478GB, 스레드 작성자인 Hannibalj2ca 조언 참고함)는 그 작업 3개를 다 해결하더라.
처음엔 하네스용으로 쓰는 Kimi CLI가 타임아웃 걸린 줄 알았음. 디코딩 때문에 스트리밍이 느려서 작업 하나당 평균 2.5시간 걸렸거든. 근데 로그 보니까 타임아웃 흔적은 전혀 없었음.
어차피 한 번씩만 돌려본 거라 내 환경 문제일 가능성이 제일 높긴 함. 그래도 'expert' 비트를 쳐낸 게 표준 2비트 버전보다 코딩 성능을 높였을 가능성이 아주 미세하게나마 남아있음. 일본어로 이걸 '微レ存(비레존)'이라고 함. '미시적인 수준으로 가능성이 존재한다'는 뜻임.
다음 할 일은 VRAM 빵빵한 장비 빌려서 'expert' 레이어 제거 전후를 동일 조건에서 비교해보는 거임. 근데 RunPod에서 빌려도 SWE-Lancer 작업 다 돌리는 데 예상 비용만 1,800달러 나옴 😭
혹시 자기 컴퓨터로 2비트 풀버전 돌릴 수 있는 사람 있으면 대신 좀 테스트해주라.
SWE-Lancer 작업 선택 및 작업별 결과:
k27_q2_2bit vs reap640_iq1s vs reap576_iq2xxs
https://github.com/01554/kimi-k3-gguf-prune/blob/main/evals/results.csv "

