Arena에서 Gemini 4 Pro로 의심되는 모델을 발견했는데, 좀 이상하네요
Just caught a suspected Gemini 4 Pro in Arena, and I noticed something weird
핵심 요약
Arena에서 Claude처럼 행동하는 의문의 Gemini 모델을 발견했다는 사용자들의 경험담이 이어지고 있습니다.
- 이상한 도구 호출 — Gemini가 Claude처럼 도구 실행 전 의도를 미리 밝히는 행동을 보임
- 모델 식별 혼란 — 3.7 Flash 라벨로 표시되었으나 성능은 훨씬 뛰어난 모델이 등장함
- 희귀한 체크포인트 — Pro 체크포인트는 매우 드물게 등장하며 금방 사라지는 경향이 있음
- 구글의 추격 — Claude의 행동 패턴을 모방하는 듯한 모습에 구글의 성능 향상 기대감 상승
일단 이거 "thinking" 접미사도 안 붙은 그냥 "gemini-3.7-flash"라는 이름으로 떴음. 사람들이 떠들던 3.8 Flash도 아니었고. 이게 진짜 3.7 Flash가 아니라는 걸 확신한 이유는, 출력 퀄리티가 Model B(Gemini 3.8 Flash low)를 완전히 압살했기 때문임. 진짜 3.7 Flash가 이런 성능을 낼 리가 없거든.
진짜 기괴했던 건 툴 호출 방식임. 다들 알다시피 Gemini 3.x는 사고 과정(chain of thought) 안에서 툴 호출을 결정하잖아. 원래는 의도를 밖으로 안 내비치고 결과값만 딱 뱉으니까, Arena에서 보면 그냥 툴이 조용히 연속으로 실행되는 게 정상임. 근데 이 모델은 무슨 Claude마냥 행동하더라. 툴 실행하기 전에 "내가 ~할게", "잠깐 ~해볼게" 이런 식으로 모든 단계마다 지가 뭘 할지 미리 다 떠벌리고 앉았음.
그래서 난 이거 100% Claude 변종이라고 생각하고 채점하고 있었는데, 정체 밝혀지고 나서 진짜 머리 깨지는 줄 알았다. Anthropic이랑 DeepMind가 테스트 슬롯 바꿔치기하거나 변장 공유할 정도로 친한 사이도 아닐 테니, 이건 빼박 Gemini 4인 듯.
몇 번 더 돌려보면서 다시 낚아보려고 했는데 똑같은 놈은 안 나오더라. 혹시 너네도 이 후보 모델 만나본 사람 있냐? 나처럼 툴 호출 전에 말 많은 거 본 사람?
