다들 어떻게 지내시나요? Opus 5로 진행하는 프로젝트는 끝이 나긴 하나요?
How are you all doing? Do your projects with Opus 5 ever come to an end?
핵심 요약
Opus 5의 성능 저하와 신뢰성 문제로 인해 프로젝트 완수에 어려움을 겪는 사용자들의 경험과 불만이 공유되고 있습니다.
- 성능 저하 논란 — 이전 버전인 Opus 4.8보다 지시사항을 무시하고 결과물이 부정확함.
- 신뢰성 문제 — 모델이 잦은 실수를 범해 프로젝트 완수가 어렵고 지속적인 수정이 필요함.
- 벤치마크 의문 — 실제 체감 성능과 벤치마크 결과 사이의 괴리에 대해 의구심을 표함.
- 업무 방식 차이 — 코딩과 일반 지식 업무 등 분야에 따라 모델 활용도와 신뢰도가 다르게 나타남.
Opus 5를 서브 에이전트로 쓰겠다는 얘기가 아님. Opus 5가 프로젝트 전체를 도맡아서 수행하는 상황을 말하는 거임.
Opus 5 출시되고 나서 엄청 굴려봤음. 그전에는 Opus 4.8 xhigh를 주구장창 썼고. 근데 Opus 5로 넘어가고 나서는 한동안 뭐가 어떻게 돌아가는 건지 감도 안 잡히더라. Opus 5가 4.8보다 나은 게 맞나? 싶었는데, 그냥 당연히 더 좋겠거니 하고 넘어갔지.
근데 프로젝트 진행하다 보니까 끝을 못 보고 있다는 걸 깨달음. 계속 수정하고, 실수 잡고, 어디서 뭐가 잘못됐나 확인하느라 시간 다 보내고 있더라고. 레딧에서 사람들 얘기하는 거 보고 나도 직접 테스트랑 소규모 연구 좀 해봤는데, 결국 범인은 Opus 5였음.
생각하는 수준(thinking level)을 뭘로 설정하든 똑같음. Medium 같은 낮은 단계에서는 그나마 좀 나은데, 내가 하는 작업에서는 지시사항의 절반 정도를 그냥 씹거나 무시함. 빨리 끝내려고 대충대충 넘어가고 숏컷만 쓰려고 함. 깊게 생각하면서 일하는 꼴을 못 봄. 그냥 엉망진창으로 일 처리를 함.
벤치마크 점수는 도대체 어떻게 뽑아낸 건지 이해가 안 감. 내가 직접 테스트해 본 결과로는 Opus 4.8이 Opus 5보다 압도적으로 나음. 심지어 Opus 4.8이 Fable 5에 훨씬 가까움. Opus 5는 Fable 5랑 비교도 안 되고. 벤치마크 결과들이 왜 다 저 모양인지 도무지 납득이 안 감.
내 작업 환경에서 Opus 5로 생산성 있게 일하는 건 불가능함. 완전히 신뢰할 수 없는 모델이니까. 이 모델에서 유일하게 믿을 수 있는 건 '무조건 실수를 한다'는 사실뿐임. Opus 5는 1도 못 믿겠음.
너네는 이거 어떻게 다루고 있는지 궁금함. 여기 레딧에서도 나랑 비슷한 경험 하는 사람들 글 몇 개 봤는데, 다들 어떻게 하고 있는지 좀 알려주라.


