Opus 5: 다들 RL 때문에 맛이 가고 실수투성인가요?
Opus 5: extremely RL-fried and mistake-prone for anyone else?
핵심 요약
Opus 5의 성능 저하와 잦은 실수에 대한 사용자들의 불만과 경험담 공유.
- 성능 저하 — 복잡한 프로젝트에서 코드 오해 및 잦은 실수 발생
- 기억력 문제 — 작업 수행 후 내용을 잊거나 불필요한 코드 삭제
- 과도한 자신감 — 모델이 실제보다 성능이 좋다고 착각하는 듯한 행동
- 사용자 경험 — 사용자마다 성능 체감이 극명하게 갈리는 상황
보통 사람들이 새 모델이 별로라고 하면 좀 눈을 흘기곤 하는데, Opus 5는 솔직히 어떤 작업에도 영 별로임. 크고 복잡한 프로젝트에서 가능한 모든 역할로 철저하게 테스트해 봤는데, 모든 작업에서 엉망임. "그래도 서브 에이전트로는 괜찮아"라는 말을 계속 듣는데, 서브 에이전트로도 전혀 아님. 심지어 정찰용으로 코드 읽을 때도 코드를 확실하게 잘못 해석함.
"그냥 작업 수행"하고 나서 바로 자기가 뭘 했는지 잊어버리는 심각한 문제가 있음. 예를 들자면, 리버스 엔지니어링 중에 갑자기 엄청 중요한 네이티브 함수가 쓸모없다고 판단해서 주석 처리해 버렸고, 엔진을 망가뜨린 뒤에는 자기가 그랬다는 사실조차 잊어버림. Fable이랑 Opus 4.8로 같은 엔진에서 몇 달 동안 비슷한 작업을 해왔는데, 이런 종류의 실수는 한 번도 일어난 적이 없음.
내 직감으로는 이건 그냥 Opus 4.8 베이스 모델에 Fable 5 로짓으로 RL을 너무 먹여서, 실제로는 아닌데도 자기가 파라미터 10배는 더 많은 모델인 줄 착각하게 만든 것 같음. 그 결과 극도의 과신과 기억상실증이 나타나는 거지.


