Opus 5.5 출시 때 실수가 없었다고 말하는 사람들을 보면 무서워짐
When people say Opus 5.5 never made a mistake on launch, I get scared.
핵심 요약
모델 성능 저하 논란에 대해, 작성자는 AI의 실수는 원래 발생하는 것이며 사용자 오류나 기대치 문제일 수 있다고 지적합니다.
- 성능 저하 논란 — 모델이 출시 초기부터 완벽했다는 주장은 근거가 부족하며 실수는 원래 발생함
- 사용자 오류 가능성 — 프롬프트 작성 방식이나 CLAUDE.md 설정 등 사용자의 활용 능력도 중요함
- AI 의존성 경계 — AI가 인간을 더 게으르고 오만하게 만들고 있다는 우려 제기
- 객관적 평가의 어려움 — LLM 성능 측정은 변수가 많아 과학적으로 증명하기 매우 까다로움
또 너프 논란이냐? 성능 차이가 존재한다는 건 인정하는데, opus 5.5가 출시 때 실수 한 번 안 했다고 주장하는 애들은 모델이 뒤에서 뭔 짓을 하는지 제대로 보지도 않는 거 같다.
이 모델들, 특히 코딩할 때는 진짜 좋은 거 맞거든. 근데 프롬프트를 한 번에 완벽하게 처리하느냐로 모델 성능을 판단하는 건 솔직히 제정신이 아니라고 본다. 5.5도 출시 때부터 내 작업에서 실수하거나 버그 섞어놓은 적 많았어. 모델이 멍청해서가 아니라, 원래 소프트웨어 개발하다 보면 버그는 당연히 나오는 거니까. 버그가 왜 생기는지 생각해 봐. 보통 요구사항을 놓쳤거나, 로직이 덜 다듬어졌거나, 사용자가 시도하기 전까진 생각지도 못한 케이스가 튀어나오거나, 아니면 그냥 코드를 개판으로 짰거나지.
난 너프가 됐다는 말을 도저히 믿을 수가 없는 게, 성능은 거의 그대로인 거 같거든. 무엇보다 난 애초에 5.5가 실수 안 할 거라고 믿은 적이 없어. 그건 그냥 순진한 생각이지. 너프 안 됐다고 하는 애들은 겉만 보고 속은 안 뜯어본 거다. 개발자가 아니더라도 Claude한테 테스트 코드 짜달라고 해서 결과물 검증하는 법 정도는 배울 수 있잖아. 여기서 말하는 테스트는 기능 테스트를 의미하는 거고.
또 하나 거슬리는 건, Claude 쓰다가 답답하면 무조건 모델 탓만 한다는 거야. 사용자 본인 실수는 생각 안 하냐? 프롬프트는 제대로 짜고 있는 거 맞아? Claude.md 파일은 네가 시키려는 작업에 맞게 잘 작성해 뒀어? 네가 해결하려는 문제를 너 스스로는 제대로 이해하고 있긴 하냐? 더 말할 수도 있는데, 뭔 말인지 알지?
모르겠다. AI 때문에 다들 점점 게을러지고 뻔뻔해지는 거 같아. 특히 우리 대부분은 결과물도 안 나올 취미 프로젝트에나 이거 쓰고 있잖아.

