직감: Qwen3.8-27B의 일반 상식 데이터가 가지치기(pruning)된 것 같음 (사실이라면 좋은 일)
A hunch: Qwen3.8-27B's general knowledge got pruned (good, if true)
핵심 요약
Qwen3.8-27B 모델이 이전 버전보다 일반 상식 능력이 떨어진다는 의혹에 대해, 모델의 전문화 과정에서 발생한 현상이라는 분석이 지배적입니다.
- 모델 성능 변화 — 이전 모델 대비 일반 상식 및 지리적 정보 인식 능력이 저하됨
- 데이터 가지치기 — 코딩 및 에이전트 능력 향상을 위해 일반 지식을 희생했을 가능성 제기
- 학습의 한계 — 파인튜닝 과정에서 발생하는 파괴적 망각 현상이 지식 손실의 원인일 수 있음
- 모델 전문화 — 소형 모델이 범용성보다는 특정 작업에 특화되는 방향으로 발전하고 있음
내 고향에 있는 유적지 사진으로 이미지 프롬프트 테스트를 항상 해보거든. 독일의 작지만 꽤 유명한 인구 25만 명짜리 도시야. 그냥 모델한테 이 사진이 어느 도시에서 찍힌 건지 물어보는 식이지.
27B랑 35B A3B 변형 모델 둘 다 3.6 버전에서는 정답을 맞힐 때도 있고 틀릴 때도 있었어. 그러니까 이 특정 정보에 대한 신호가 원래부터 좀 약했던 거지.
35B 모델이 정답을 더 자주 맞히긴 했는데, 최소한 모델의 추론 과정에서는 엉뚱한 최종 답을 내뱉더라도 내 도시를 언급하는 경우가 많았어.
두 모델 다 힌트 몇 개만 던져주면 쉽게 정답으로 유도할 수 있었고, 그 뒤에는 역사나 풍경, 주변 환경에 대해 꽤 그럴듯한 추가 정보도 내놓더라고.
반면에 Qwen3.8-27B는 이 도시를 거의 모르는 수준이야. 풍경이나 주변 건물에 얽힌 유명한 역사적 사실 같은 건 아예 감도 못 잡고 있어.
힌트를 줘도 별 효과가 없고, 도시 이름을 직접 알려줘도 추론 과정을 보면 그냥 사용자가 그렇다고 하니까 억지로 맞장구치는 수준이야.
Qwen 연구소에서 코딩 능력이나 에이전트 성능을 높이려고 쓸모없는 일반 상식 데이터를 쳐낸 게 아닌가 싶은 느낌이 들어.
모든 모델은 q4_k_xl 변형을 썼고, image-min-tokens 2048, 추론 기능 켜고 끈 상태 둘 다 테스트해 봤어.
혹시 나랑 똑같은 느낌 받은 사람 또 있어?
면책 조항: 내 예감이 그냥 개소리일 수도 있음. 표본 크기도 너무 작고 방법론도 존나 허술함.
