오늘따라 Opus 4.6이 너무 멍청하게 느껴짐
Opus 4.6 Seems Super Dumb Today
핵심 요약
Opus 4.6의 성능 저하와 일관성 없는 동작으로 인해 개발자들이 겪는 불편함과 불만을 토로하는 글.
- 코드 품질 저하 — 코드베이스를 제대로 읽지 않고 엉뚱한 가정을 하거나 불필요한 기능을 남발함.
- 일관성 부족 — 이전과 달리 스스로 말을 바꾸거나 간단한 수정에도 과도하게 복잡한 리팩토링을 제안함.
- 비용 효율성 — 5시간 제한 내에서 회귀 테스트를 돌리느라 토큰과 시간을 낭비하게 됨.
- 사용자 경험 — Anthropic의 무분별한 제한과 성능 저하로 인해 서비스 품질이 심각하게 떨어짐.
Opus 4.7이 쓰레기라는 건 이미 익숙해져서, 개선을 기대하며 Opus 4.6으로 바꿨는데 뇌가 뽑힌 것 같은 상태라 미치겠음. 돈 내고 쓰는 서비스인데 품질은 일관성도 없고, 그냥 입에 오줌이나 싸갈기는 꼴임.
몇 가지 예시를 들자면:
예전에는 Claude가 변경 사항을 만들기 전에 코드베이스를 선제적으로 확인했음(시작부터 딴지 걸지 마라, 난 global Claude.MD에 "think before code" 명령어를 넣어둔 파워 유저임). 근데 지금은 코드베이스를 읽지도 않고 멋대로 가정함. 고장 나지도 않은 걸 고치려 들어서 커밋할 때마다 회귀 테스트를 위해 시니어 코드 리뷰어를 돌려야 함. 작은 수정에도 자꾸 superpowers를 실행하는데, 전혀 필요 없는 짓임. 한 달 끝날 때쯤엔 껍데기만 남은 멍청한 AI를 받는데 왜 환불이 안 되는지 이해가 안 감. 서비스 품질이 일관적이어야 하는 거 아님?
게다가 Claude는 완료 시간을 환각으로 지어내고, 쉬운 작업만 하려고 함. 기능을 끝내라고 하면 "이건 대규모 리팩토링이 필요해서 2주 걸릴 수도 있는데, 그냥 대충 만든 이 제안으로 가는 건 어때?"라고 함. 이런 실랑이 때문에 내 시간과 토큰만 날아가고 있음. 내가 월초에 돈 낸 서비스가 이런 게 아니라고.
또 하나 발견한 건 작업 중에 스스로 말을 바꾼다는 거임. 수정을 시작했다가 "아, 알겠다, 저걸 바꿔야겠네"라고 하더니 방금까지 하던 거랑 정반대 짓을 함.
오늘처럼 Claude를 애 보듯 돌봐야 했던 적은 없었음. 내가 global에 넣어야 하는 내용의 90%는 Codex가 알아서 처리하던 것들임. 시니어 코드 리뷰어는 차치하고, 이제는 커밋할 때마다 인접 코드의 회귀를 확인하는 에이전트까지 돌려야 함. 더 웃긴 건 이 회귀 테스트가 피크 타임에 5시간 제한을 다 잡아먹는다는 거임.
Anthropic 사람들은 사용량 제한을 몰래 너프하고, 품질을 떨어뜨리는 등 계속 우리 발목을 잡고 있음. 기존 기능도 제대로 작동 안 시키면서 새 기능이 다 무슨 소용임? Anthropic은 정신 좀 차려야 함. 사용자가 6/7일 남았을 때 주간 제한을 초기화해봤자 서비스 품질이 이따위면 아무 의미 없음.


