Fable 5나 GPT-5.6 Sol이 Opus 5.0보다 낫다.
Fable 5 or GPT-5.6 Sol > Opus 5.0.
핵심 요약
Opus 5의 성능 저하와 벤치마크의 괴리에 대한 사용자들의 불만과 Fable 5 및 이전 모델 선호 현상.
- 벤치마크 신뢰도 — 실제 업무 환경과 벤치마크 결과 사이의 큰 괴리가 발생함.
- Opus 5 성능 저하 — 과도한 자신감으로 오류를 범하고 생산성을 떨어뜨림.
- 모델 선호도 — 코딩 작업에서 Fable 5와 Sol이 더 안정적이고 유능함.
- 워크플로우 복구 — Opus 5의 문제로 인해 이전 버전(4.8)으로 롤백하는 사례 증가함.
이제 벤치마크 같은 건 진짜 못 믿겠다.
Opus 5는 뭐만 시키면 더닝-크루거 효과마냥 아는 척 오지게 해대서 문제야. 틀린 부분은 뻔히 보이는데 엄청나게 자신만만하게 굴거든. 심지어 그 실수들을 그대로 프로덕션에 박아버릴 뻔한 적도 한두 번이 아니고, 지가 틀려놓고 나랑 말싸움까지 하려고 들어. 게다가 그 특유의 말투도 진짜 짜증 나 죽겠음.
그러다가 딱 집어서 "여기 틀렸잖아"라고 하면 그제야 바로 꼬리 내리고 깨갱함.
반면에 Fable 5나 Sol은 느낌이 확 달라. 얘네도 자기주장은 하는데, 진짜로 틀렸다는 걸 증명해내지 않는 이상 쉽게 굽히지 않거든.
내가 코딩 모델한테 바라는 게 딱 이거야. 무지성으로 "네 알겠습니다" 하는 게 아니라, 근거 있는 자신감을 보여주는 거.
벤치마크 결과(https://artificialanalysis.ai/)만 보면 Opus가 더 낫다고 나오지. 근데 내가 직접 프로덕션에서 굴려본 경험은 전혀 달라. 나 지금 Anthropic이랑 OpenAI 둘 다 20배 구독료 내면서 쓰고 있는 사람이라고.

