구글이 진짜 제대로 해낸 걸까, 아니면 그냥 벤치마크 점수 놀음의 정점을 보고 있는 걸까?
Did Google actually cook, or are we just witnessing peak benchmaxxing?
핵심 요약
구글의 새로운 AI 모델 성능을 두고 벤치마크 수치와 실제 사용 경험 사이의 괴리에 대한 의구심이 제기됨.
- 벤치마크 신뢰성 — 모델 성능 지표가 실제 사용 경험과 일치하는지 의문이 제기됨.
- 구글 모델 평가 — 구글의 새로운 AI 모델이 실제 성능보다 수치상으로만 과대평가되었을 가능성이 논의됨.
- 사용자 경험 — 벤치마크 점수와 달리 실제 대화에서의 인격이나 추론 능력은 여전히 개선이 필요하다는 의견이 있음.

