Opus 4.7 좀 이상함
Opus 4.7 is weird
핵심 요약
Opus 4.7의 성능 변화와 할루시네이션 증가에 대한 사용자들의 혼란과 적응 과정.
- 성능 변화 — 이전 버전인 4.5의 직관적인 성능에 비해 4.7은 지나치게 리터럴하고 할루시네이션이 잦음.
- 프롬프트 재설계 — 4.7의 특성에 맞춰 프롬프트와 스킬을 새로 작성해야 하며, 부정적 지시보다 긍정적 지시가 효과적임.
- 코드 품질 논쟁 — 일부 사용자는 4.7이 코드 작성에 탁월하다고 평가하지만, 다른 이들은 잦은 오류와 할루시네이션을 지적함.
- 사용자 적응기 — 모델의 변화에 따라 프롬프트 엔지니어링 방식을 바꾸며 적응하려는 사용자들의 노력이 이어짐.
나는 Claude를 하루 종일 업무에 사용하기 때문에 Claude 안에서 산다고 해도 과언이 아니다.
Opus 4.5는 특별한 모델이었다. 완벽해서가 아니라, 처음으로 내가 일일이 손을 대지 않아도 된다는 느낌을 받았기 때문이다. 마치 모델이 내 마음을 읽고 행간의 의미를 정확히 해석하는 것 같았다.
이런 점이 빠른 속도와 결합되었고, 스킬과 서브 에이전트가 자리를 잡아가던 시기에 출시되어 정말 즐겁게 사용했다. AI가 실제 업무를 수행할 수 있다고 믿게 된 첫 경험이었고, Claude Pro 구독이 처음 나왔을 때부터(20x max는 훨씬 나중에 나왔지만) 계속 구독 중이다.
그러다 Opus 4.6이 나왔는데, 솔직히 처음엔 별로였다. Claude와 이 모델에 대해 이야기했던 기억이 나는데, 그냥 아부성 환각일 수도 있지만 모델이 더 절제된 상태라고 하더라.
그 후 Opus 4.6이 점점 좋아졌는데, 특히 1M 컨텍스트 윈도우 덕분에 긴 대화에서도 훌륭한 일관성을 보여줬다. 하지만 Opus 4.5의 마법 같은 느낌은 여전히 좀 사라진 상태였고, 사람들이 여전히 그 모델을 그리워하는 이유가 바로 이것이라고 생각한다.
그리고 Opus 4.7…
솔직히 어디서부터 시작해야 할지 모르겠다. 출시 당일과 며칠 동안 Claude Code에서 뭔가 확실히 고장 나서 사용하는 내내 순수한 좌절감을 느꼈다는 말부터 해야겠다. 사소한 UI 변경에 대해서도 한참을 생각하는 것 같았다. 솔직히 나는 항상 max thinking을 사용하는데, GPT 모델들과 달리 Claude 모델들은 보통 토큰을 얼마나 생각에 쓸지 훨씬 잘 결정하는 편이다.
그들이 버그를 수정했다는 포스트모템을 발표한 건 알지만, 솔직히 Claude Code에서 지금 느껴지는 것과는 너무 달라서 설명되지 않은 버그가 더 있다고 생각한다. 사실, Claude Code를 다룰 줄 안다면 Opus 4.7(max thinking 사용 시)이 내가 써본 최고의 코딩 모델이라고 감히 말할 수 있다. 내 지표 중 하나는 항상 내 diff에 대해 최소 두 번의 코드 리뷰를 한다는 것인데(하나는 Codex, 하나는 새로 만든 Opus 에이전트 군단), 4.7이 작성한 코드에서 문제를 훨씬 적게 발견하고 있다. 아예 없는 건 아니지만.
그리고 여기서부터가 이상한 부분이다. 이 모델은 더 자신감 있게 행동하도록 훈련된 것 같다. 그래서 똑같이 생긴 웹사이트들을 만들어내는데(그렇다고 나쁘게 생기진 않았다), 동시에 엄청난 퇴보라고 느껴질 만큼 할루시네이션이 증가했다. 업무 외적인 부분에서 가장 많이 느끼는데, 내 메모 편집에는 "불확실한 점은 모두 표시하라"는 규칙이 있다. Opus 4.6은 그렇게 했지만, 이 모델은 신경 쓰지 않는다. 그냥 자신의 서사에 맞춰 세상과 컨텍스트를 자신 있게 끼워 맞춘다.
결론적으로 Opus 4.5와 작업할 때와는 정반대의 느낌이다. 4.5는 내 상황에서 어떻게 하면 가장 도움이 될지 고민하는 느낌이었다면, 4.7은 내가 작업 중인 규칙을 계속 상기시켜야 하고 대화의 흐름과 컨텍스트를 계속 주시해야 한다. 그냥 자기만의 판타지를 만들어내고 그걸 밀고 나가기 때문이다.
Claude.ai에서는 plan 모드를 사용할 수 없고, 응답하기 전에 반복 작업을 할 수도 없으며, 대부분의 경우 그렇게 하고 싶지도 않기 때문에 최악이라고 말하는 것이다.
Anthropic은 프롬프트를 다르게 작성해야 한다고 말하는데, 맞는 말이긴 하지만 짜증 난다. 기본적으로 그들의 말은 "우리가 모델을 만들었는데, 명확한 가이드라인이 있는 아주 구체적이고 잘 짜인 작업을 주면 당신이 본 최고의 AI가 될 것이다"라는 뜻이다. 하지만 다른 모델들의 거의 마음을 읽는 듯한 능력을 경험해 본 나로서는, 이건 퇴보처럼 느껴진다.
이 글이 누군가에게 도움이 될지는 모르겠지만, 질문이 있거나 더 논의하고 싶은 분들과 이야기 나누고 싶다 :)
정말 이상한 경험을 하고 있어서 공유해야만 했다.

