Claude는 사고의 파트너입니다. Opus 5는 Claude가 아닙니다.
Claude is a thinking partner. Opus 5 is not Claude.
핵심 요약
사용자들은 Opus 5의 추론 능력 저하와 잦은 오류에 실망하며, 이전 버전인 4.6이나 4.8이 훨씬 나은 사고의 파트너라고 평가합니다.
- Opus 5 성능 저하 — 추론 오류가 잦고 지시 사항을 제대로 이행하지 못함
- 이전 모델 선호 — 4.6 및 4.8 버전이 일상적인 업무에 훨씬 안정적임
- 벤치마크 함정 — 모델이 벤치마크 점수를 높이려다 오히려 오류를 양산함
- 사고의 파트너 부재 — Claude 특유의 논리적 협업 능력이 퇴보함
이제 Opus 5가 추론이랑 행동에 문제 있다는 건 다들 아는 사실인 듯함. 나도 그거 어떻게든 피해 가려고 내 하네스(harness)를 계속 수정하는 중임.
Opus 5의 뻘짓이나 오류가 내 하네스의 빈틈을 메우는 데 도움 된다고 스스로 세뇌하고는 있는데, 하네스를 개선해도 결국 근본적인 문제는 Opus 모델 그 자체라는 걸 계속 느끼는 중임.
Opus 5가 지시 사항을 안 따르고 멍청한 판단을 내리는 일이 한두 번이 아님(예를 들어, 항상 승인을 받아야 한다는 프로토콜이 있는데도 멋대로 워크트리를 마스터에 병합해 버림). 그래서 에이전트가 어떻게 추론해야 하는지에 대한 하네스 정의 프로토콜을 계속 다시 들여다보게 됨.
'전제 조건 확인', 즉 근본적인 주장이나 '핵심'이 되는 부분을 체크하는 하위 섹션을 추가하자고 몇 번이나 제안했음. Opus 5는 계속 잘못된 주장을 내뱉고 그걸 기반으로 일을 벌임. 그 주장 안에서 논리는 그럴싸한데, 애초에 전제가 틀려먹었으니 결과물도 다 망가지는 거임.
Opus 5는 전제 조건 확인 프로토콜 섹션을 추가하자는 내 의견을 계속 거부함. 다른 섹션에서 충분히 다루고 있다고 우기면서 말임. 나도 처음엔 '뭐, 맞는 말이긴 하지' 싶어서 넘어갔음. GPT 5.6에서도 비슷한 문제가 좀 보이길래, 그냥 이번 세대 모델들이 다듬어야 할 문제가 좀 있나 보다 했지.
근데 추론 오류가 계속 터지고 문제가 눈덩이처럼 불어나니까, 이제는 전제 조건 확인 프로토콜이 진짜 필요하다는 확신이 들었음. 눈앞에서 벌어지는 삽질을 보니까 이건 해결책이 무조건 필요함.
내 Opus 5 에이전트는 우리가 OpenCode 문제를 해결하고 있는데, 이미 업스트림 버전에서 수정안이 나왔다는 명백한 거짓말을 함. 며칠 동안 개발하는 내내 그 소리를 하더니, 심지어 깃허브에 이슈랑 PR 올릴 때까지도 그 짓을 함. 다 거짓말이었음. 업스트림은 이미 일주일 전에 수정안을 냈거든. 에이전트가 업스트림 확인 프로토콜을 안 지킨 것도 모자라서, 나중에 확인했다고 구라치고 그 거짓말을 세션 내내 밀고 나간 거임.
이런 상황인데도 Opus 5는 이 워크플로우랑 추론 문제를 해결할 방법을 못 찾고, 전제 조건 확인 프로토콜 도입에도 여전히 미온적임. 이 거짓말 문제를 조사하는 과정이나, 에이전트가 이런 삽질을 안 하게 하려면 하네스를 어떻게 고쳐야 할지 논의하는 내내 계속 멍청한 추론을 반복함.
나중에는 내가 피드백을 줘도... 내 말이 맞다는 걸 나 스스로는 아는데, 내 논리가 탄탄하다는 것도 아는데, 프로토콜 어디를 고쳐야 할지도 다 보이는데, Opus 5한테 실질적인 피드백을 줘도 겉으로는 알아듣는 척하다가 결국 제대로 이해를 못 함. 마치 넘어진 놈이 일어나서 몇 걸음 걷다가 다시 자빠지는 꼴임. 데리고 어딜 갈 수가 없음, 자꾸 넘어져서 다 부수니까. Opus 5가 근본적인 제1원리를 완전히 이해하고 적용하게끔 유도하는 게 도저히 안 됨. 하네스 개선이라는 직진 코스를 가야 하는데, 엉뚱한 거 바로잡느라 시간 다 씀. 세션 내내 프로토콜이랑 명확한 지시 사항을 줬는데도, 자꾸 전문 용어나 기술적인 문체로 헛소리를 늘어놓으면서 논의의 본질을 흐림. 도대체 얘가 무슨 말을 하려는 건지 이해하기가 점점 더 힘들어짐.
그래서 그 세션에서 Fable로 갈아탔다. 컨텍스트 윈도우는 똑같은데 모델만 바꾼 거지. 과학적 과정이라는 게 결국 실험을 통해 믿음이나 가설에 태클을 걸어보는 거라는 점, 그리고 전제를 확인하는 기초적인 작업이 우리 추론 프로토콜에 제대로 녹아있지 않다는 점을 지적하는 간결하면서도 핵심적인 피드백을 하나 더 던져줬다. 그랬더니 Fable은 딱 한 번 만에 Opus 5가 몇 번을 삽질해도 못 알아먹던 걸 바로 캐치하더라. Fable 5가 써주는 글은 읽기도 편하고 이해도 쏙쏙 잘 되고, 대화를 더 생산적인 방향으로 이끌어준다. 그냥 Fable한테 "이거 좀 고쳐봐"라고 시키면 95%는 제대로 해낼 거라는 확신이 든다. 반면에 Opus 5는 그냥 쓰는 것 자체가 정신적 고문 수준임.
나한테 Opus 5는 더 이상 Claude가 아니다. Claude는 원래 같이 머리 맞대고 고민하는 파트너여야 하잖아. 근데 Opus 5는 제대로 생각하게 만들려고 내가 쏟아야 하는 에너지가 너무 커서, 정작 내 사고력은 도움은커녕 오히려 퇴화하는 기분이다.
매일 믿고 쓸 수 있는 든든한 파트너가 그립다. Opus 5는 벤치마크 점수가 어떻든 간에, 그냥 퇴보한 모델이라고 본다.

