Opus 5.5의 자신감을 주의하세요
Be careful with Opus 5.5’s confidence
핵심 요약
Opus 5.5가 코드 분석 시 불완전하거나 잘못된 결과를 내놓는 문제에 대한 사용자들의 경험 공유.
- Opus 5.5 신뢰도 — 코드 분석 시 불완전하거나 잘못된 결론을 내리는 경우가 잦음.
- 검증 절차 필요 — 모델이 스스로 검토하게 하거나 별도의 검증 단계를 거쳐야 함.
- Anthropic의 개입 — 모델의 행동을 강제하는 내부 지침과 '적응형 사고' 기능이 성능을 저해함.
- 워크플로우 최적화 — 후크나 에이전트 활용을 통해 모델의 성급한 판단을 방지하려는 시도들.
출시 때부터 이랬던 건지 아니면 오늘만 이러는 건지 모르겠는데, Opus한테 문제 좀 봐달라고 하면 맨날 조사를 하다 말거나 틀린 결과로 결론을 내버리네.
"실수나 회귀(regression)된 부분 있는지 확인해달라"고 시키면, 거의 모든 채팅에서 방금 말한 그런 실수들을 찾아내더라고.
괜히 겁주려는 건 아니니까, 너희도 직접 한번 테스트해 봐.

