Opus 5.5와 GPT-6 Sol이 같은 날 출시되어, 찾을 수 있는 모든 벤치마크를 비교해 봄
Opus 5.5 and GPT-6 Sol dropped on the same day, so I lined up every benchmark I could find
핵심 요약
Opus 5.5와 GPT-6 Sol의 성능과 비용 효율성을 비교한 분석글입니다.
- 벤치마크 결과 — Opus 5.5가 모든 벤치마크 항목에서 GPT-6 Sol을 앞섬
- 비용 효율성 — GPT-6 Sol이 토큰당 비용이 절반 수준으로 훨씬 경제적임
- 성능 저하 — GPT-6 Sol은 이전 모델 대비 일부 작업에서 성능이 소폭 하락함
- 전략적 분석 — OpenAI가 데이터센터 효율화를 위해 가벼운 모델을 출시했을 가능성 제기
오늘 Anthropic이랑 OpenAI에서 각각 새 모델인 GPT 6 Sol이랑 Opus 5.5를 내놨길래, 제대로 한번 비교해 보려고 한다.
벤치마크 점수만 놓고 보면 Opus가 표에 있는 모든 항목에서 압승이다. 근데 좀 의외였던 건 "실제 사무 업무" 평가인 GDPval이었음. Sol이 기존에 쓰던 GPT-5.6 Sol보다 Elo 점수가 100점이나 낮게 나왔거든. Artificial Analysis 분석에 따르면, 이건 추론 능력이 딸려서가 아니라 결과물 퀄리티가 떨어지고 작업에서 요구하는 필수 항목들을 자꾸 빼먹어서 점수가 깎인 거래.
Sol의 장점은 가격이다. 토큰당 비용이 절반 수준인데, Opus는 토큰을 워낙 많이 잡아먹으니까. AA 측정 결과, 최대 성능으로 돌렸을 때 Opus 5.5는 작업당 출력 토큰이 약 119K나 나오는데, Sol은 31K 정도밖에 안 썼음. 전체 인덱스 돌리는 데 든 비용도 작업당 $1.06 수준이고.
실전에서 얘네가 어떻게 굴러갈지, 며칠 동안 어떤 피드백이 올라올지 진짜 궁금하다. 다들 어떻게 생각함?


