Qwen3.8-27B, 3.6 버전 대비 지식 능력 크게 하락
Qwen3.8-27B took a serious hit to *knowledge* vs 3.6
핵심 요약
Qwen3.8-27B 모델이 이전 버전인 3.6에 비해 일반적인 지식 회상 및 퀴즈 성능이 저하되었다는 사용자 경험 공유.
- 성능 저하 — 이전 버전인 3.6 대비 일반 지식 및 퀴즈 답변 정확도가 떨어짐
- 벤치마크 일치 — 오프라인 지식 벤치마크 결과가 실제 사용 경험과 유사하게 나타남
- 모델 활용 — 코딩 능력은 준수하나 지식 검색은 외부 도구 사용을 권장함
너희들도 그렇겠지만, 나도 지난 며칠 동안 Qwen3.8-27B를 내 평소 작업들이나 개인적인 테스트, 워크플로우에 죄다 굴려봤거든. 성능은 훌륭하고 가끔은 미친 수준이긴 한데, 이번 글에서 다룰 내용은 그게 아님.
내가 개인적으로 돌려보는 벤치마크 중에 나만 아는 잡학 지식이나 좀 마이너한 정보, 그리고 생존 관련 질문들을 섞어놓은 게 있거든. 근데 Qwen3.8-27B는 내가 어떤 양자화 레벨을 쓰든, 샘플링 설정을 어떻게 바꾸든 이 테스트에서 꽤 죽을 쑤더라. Qwen3.6에선 잘만 대답하던 질문들을 자꾸 틀려먹음.
알아보니까 오프라인(툴 호출 안 쓰는) knowledge benchmarks 결과도 내가 느낀 거랑 비슷하더라고. 잡다한 사실을 기억해내는 능력(내 테스트에선 환각 현상도 더 심했는데, 벤치마크엔 안 나왔지만)은 확실히 전작인 3.6보다 눈에 띄게 구려짐. 뭐 막대그래프만 맹신하는 건 좀 그렇지만, 이번엔 내 '감'이 그 그래프들이 맞다고 말해주고 있네.
이게 뭐 대수냐고? 꼭 그렇진 않음. 코딩할 땐 여전히 잘 돌아가는 것 같고, 다른 건 어차피 너희도 툴 호출(tool-calls) 써서 해결할 거잖아. 만약 너희가 인터넷 연결도 안 된 모델 하나만 믿고 그 안의 가중치에만 의존해서 잡지식을 캐내려는 전략을 쓰고 있다면, 이건 좀 치명적일 수 있음. 애초에 그런 방식은 망하는 지름길이긴 하지만, 혹시라도 그런 식으로 쓰고 있다면 Qwen3.8은 거르거나, 아니면 제발 MCP 서버 좀 구축해라.
그냥 좀 흥미로워서 적어봄. 너희 생각은 어떤지, 아니면 나 말고 이거 눈치챈 사람 또 있는지 궁금하네.


