Gemini 3.1 Pro는 코딩 및 장기 작업을 제외한 거의 모든 벤치마크에서 여전히 최고임
Gemini 3.1 pro is still the GOAT in almost every benchmark outside of coding/long horizon tasks.
핵심 요약
Gemini 3.1 Pro가 코딩과 장기 작업을 제외한 분야에서 뛰어난 성능과 낮은 환각률을 보인다는 분석.
- 벤치마크 성능 — 코딩 및 장기 작업을 제외한 대부분의 벤치마크에서 최상위권 유지함
- 환각률 비교 — Opus 5나 Sol 대비 낮은 환각률을 기록하며 지식 기반 작업에서 강점 보임
- 로봇 공학 — Fable 5 및 Sol과 경쟁 가능한 수준의 성능을 보유함
- 모델 한계 — 코딩 및 장기 작업에서는 성능이 다소 떨어지는 경향이 있음
이미지가 너무 많아서 링크 여기 남겨둘게: https://imgur.com/a/gpHWezC
참고로 저기에 벤치마크 일부만 들어간 거고, 실제로는 훨씬 더 많음.
로보틱스 쪽 얘기 좀 하자면, Gemini가 현재 그 분야에서 최고거나 거의 최고 수준임. Fable 5나 Sol보다 위고 (3.7이 제일 빠르긴 함).
Gemini 3.5 cyber flash도 Fable 5랑 비슷하거나 그 이상임. (물론 우리가 쓸 순 없지만, 구글이 그 정도 수준에서 경쟁하는 내부 모델들을 여전히 가지고 있다는 게 핵심임.)
아, Opus 5랑 Chatgpt Sol 비교하자면 Gemini 3.1 pro가 환각 현상 제일 적음. (Gemini 3.1은 51%인데 Opus는 61%, Sol은 92% 찍음.)
내가 써본 경험상, Sol은 문서 분석이나 검색으로 해결 안 되는 거 시키면 환각 존나 심함. 검색 못 하는 순간 바로 맛탱이 감. (순수 과학 분석, 사이버 보안, 코딩 같이 얘가 최고로 치는 분야들 빼고는 말이야.)
3.1 pro가 모든 면에서 최고라는 건 아님. 근데 순수 지식이나 내가 언급한 다른 분야들에선 최고거나 거의 최고 수준임. 코딩이랑 장기적인 작업 수행 능력은 좀 떨어지는 편이고.


