로컬 모델의 'Claude-4.6-Opus' 파인튜닝은 대부분 성능 저하를 초래함
These "Claude-4.6-Opus" Fine Tunes of Local Models Are Usually A Downgrade
핵심 요약
로컬 모델에 'Claude-4.6-Opus' 이름을 붙인 파인튜닝 버전들이 실제로는 성능을 떨어뜨린다는 비판.
- 성능 저하 문제 — 파인튜닝된 로컬 모델들이 원본보다 지능과 추론 능력이 떨어지는 현상이 반복됨.
- 마케팅 거품 — 'Claude'라는 이름을 붙인 모델들이 실제로는 얕은 지식만 갖추고 과대평가되는 경향이 있음.
- 비효율적 자원 활용 — 모델을 개선하려는 시도가 오히려 가중치를 오염시키고 컴퓨팅 자원을 낭비함.
- 검증 부족 — 단일 프롬프트나 단순한 벤치마크만으로 모델 성능을 결론짓는 방식에 대한 회의적 시각.
기본 모델의 지능과 추론 능력을 높여준다고 약속하는 파인튜닝 모델들에 대한 글을 계속 보게 되는데, 매번 시도해 보면 엉망이라 금방 삭제하게 돼. 가끔은 모델이 너무 커서 낮은 양자화 버전을 쓰기도 하는데, 이번에는 Qwen 3.5 27b의 40b 변형 모델이었지만 항상 실망만 안겨주네. 이제는 이름에 "Claude Opus 4.6"이 들어간 모델은 아예 다운로드하지 않기로 했어.
기초 모델을 더 똑똑하게 만들려고 노력하는 모든 분께 경의를 표하지만, 내 생각엔 절대 효과가 없어.
이 예시는 단일 프롬프트에 대한 일화적인 증거일 뿐이지만, WSL2 환경에서 llama.cpp와 로컬 에이전트 설정을 사용할 때는 전반적으로 항상 지능이 감소하는 결과가 나와. 양자화와는 상관없이 말이야. 많이 시도해 봤거든.
한 가지 주목할 점은, 추론/사고 능력이 현저히 떨어진다는 건데 아마 그게 문제의 일부일지도 몰라.
혹시 이런 모델들이 기본 모델보다 낫다고 느낀 적 있는 사람 있어?
첨부된 스크린샷은 다음과 같아:
./llama-server -hf mradermacher/Qwen3.5-27B-heretic-GGUF:Q4_K_S --temp 1.0 --top-p 0.8 --top-k 20 --min-p 0.00 --fit on --alias default --jinja --flash-attn on --ctx-size 262144 --ctx-checkpoints 256 --cache-ram -1 --cache-type-k q4_0 --cache-type-v q4_0 --threads 8 --threads-batch 16 --no-mmap
./llama-server -hf mradermacher/Qwen3.5-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-i1-GGUF:i1-Q3_K_S --temp 1.0 --top-p 0.8 --top-k 20 --min-p 0.00 --fit on --alias default --jinja --flash-attn on --ctx-size 131072 --ctx-checkpoints 256 --cache-ram -1 --cache-type-k q4_0 --cache-type-v q4_0 --threads 8 --threads-batch 16 --no-mmap


