소형 모델들이 무서울 정도로 좋아지고 있습니다.
Smaller models are getting scary good.
핵심 요약
31B 소형 모델 Gemma 4가 대형 모델 Gemini의 논리적 오류와 가짜 수학을 잡아내며 압승한 사례에 커뮤니티가 열광 중.
- 소형 모델의 역습 — 31B 규모의 Gemma 4가 거대 모델인 Gemini의 논리적 허점과 가짜 수학을 완벽하게 지적함.
- 에이전트적 검증 — 소형 모델이 도구를 활용해 대형 모델의 결과물을 피어 리뷰하고 굴복시키는 성능을 보여줌.
- 시스템 프롬프트의 한계 — 대형 모델이 정답을 강요받는 내부 규칙 때문에 역설을 인지하지 못했을 가능성이 제기됨.
- 지수적 기술 발전 — 작년의 플래그십 성능을 올해의 소형 모델이 따라잡는 AI 발전 속도에 대한 경탄이 이어짐.
아직도 이거 소화 중임 ㅋㅋㅋ
Gemini 3 Pro Deepthink에게 복잡한 보안 퍼즐(사실은 해결 불가능한 역설이었음)을 풀게 시켜봤음. 약 15분간의 추론 끝에 믿을 수 없을 정도로 전문적이고 고도로 구조화된 답변을 내놓더라고. 그냥 재미 삼아 그 솔루션을 Gemma 4 (31B)(도구 활성화 상태)에게 넘겨봤음.
Gemma가 그걸 완전히 박살 내버렸음. Gemini가 정답을 억지로 맞추려고 몰래 끼워 넣은 물리적 제약 위반과 가짜 수학 방정식을 잡아냈음. 논리적 결함을 명시적으로 지적하면서 Gemini에게 "출력물의 전문성에 눈이 멀었다"라고 일침을 가함. 잔인할 정도임.
가장 미친 부분은? 31B의 논리를 다시 Deepthink에게 먹였더니... 즉시 굴복하면서 내부 검증에 실패했고 논리가 깨졌음을 인정함.
너희들도 전체 토론을 읽어볼 수 있게 HTML 로그를 첨부했어. 31B 오픈 웨이트 모델이 에이전트적 피어 리뷰를 수행하고 프론티어 MoE 모델을 괴롭혀서 굴복시킬 수 있다는 사실이 나에겐 정말 미친 것 같아. 파일 확인해봐.
TIL: 큰 모델이 항상 더 똑똑한 건 아니다... 적어도 매번 그렇지는 않음.


