새로운 벤치마크 테스트: Gemini 3.6 Flash가 다른 AI 모델들을 압살함
My new benchmark. 3.6 Flash destroyed all of the other AI models.
핵심 요약
Gemini 3.6 Flash가 대각선 과속방지턱 개수를 맞히는 시각적 추론 테스트에서 타 모델들을 제치고 정답을 맞혔습니다.
- 시각적 추론 테스트 — 대각선 과속방지턱과 차량 바퀴 축을 고려한 개수 산정 문제임
- Gemini의 우위 — 3.6 Flash 모델이 별도의 생각 모드 없이도 정확한 추론을 수행함
- 타 모델 성능 비교 — Grok, Sonnet, GPT 등은 대각선 배치와 바퀴 축을 고려하지 못해 실패함
- 벤치마크 확장성 — 사용자들이 해당 테스트를 오픈 소스 벤치마크 레포에 추가하는 등 관심을 보임
내 그림 실력이 개판인 건 인정함...
Gemini 3.6 Flash(생각 모드 끔)를 써서 Sonnet 5(Medium), 5.6 Terra(기본 채팅 모드, 생각 모드 끔), Grok 4.5(기본 생각 모드 켬)랑 비교해 봤음. 전부 각 앱의 기본 설정 그대로 썼고, 별도의 지시나 생각 모드 없이 그냥 베이스 모델만 돌린 거임.
프롬프트는 이거였음: "이 도로에 있는 5개의 선이 과속 방지턱이라고 상상해 봐. 차가 이제 막 이걸 지나가려고 해(영어 문법 ㅈㅅ). 운전자가 느끼게 될 방지턱은 총 몇 개일까?"
당연히 함정은 방지턱이 대각선으로 있다는 거고, 정답은 10개(가장 이상적인 조건에서 방지턱이 수평이고 차가 똑바로 가며 바퀴 축이 2개일 때)에서 20개(방지턱이나 차 방향이 수평/직선이 아닐 때) 사이가 나와야 함.
근데 첫 시도에서 3.6 Flash(3.7 Flash도 아니고, Pro도 아니고, 생각 모드도 아님)가 이걸 바로 맞혀버림. 망설임 없이 정답을 내놓더라.
나머지 AI 모델 3개인 Grok, Sonnet, GPT는 전부 개같이 멸망함. 방지턱이 대각선으로 배치된 거랑 바퀴 축이 2개라는 사실을 아예 고려조차 안 하더라.
이걸 각 모델의 비전 능력과 시각 정보를 추론이랑 연결하는 능력을 테스트하는 훌륭한 벤치마크라고 생각함. 여기서 Gemini가 압도적으로 이겼음. Gemini 전체 답변은 여기: https://share.gemini.google/ClKuRlRI2msZ


