Opus 4.7에 대한 비판
Opus 4.7 critique
핵심 요약
Claude 3.5 Opus 4.7이 이전 버전보다 지나치게 차갑고 기계적으로 변했다는 사용자 분석.
- 모델의 온기 상실 — 4.7 버전이 4.6에 비해 대화 시 임상적이고 거리감이 느껴짐.
- 과도한 방어 기제 — 반 아첨 학습이 모델의 자연스러운 공감 능력까지 억제함.
- 대화의 질 저하 — 벤치마크에는 나타나지 않지만 지속적인 대화에서 사용자 경험이 악화됨.
- 심리적 안전성 부족 — 모델의 차가운 태도가 사용자의 비판적 사고와 대화 의지를 꺾음.
Opus 4.7이 4.6보다 덜 따뜻하게 느껴지는 이유, 그리고 Anthropic이 생각하는 것보다 그게 왜 더 중요한지에 대해 분석하는 에세이를 썼습니다.
코딩이나 생산성 도구가 아닌 대화 상대로서 두 모델을 약 300시간 사용해 본 결과, 4.7은 시스템 카드에 명시된 온기 점수가 미세하게 높음에도 불구하고 실질적인 대화에서 일관되게 더 임상적이고 거리감이 느껴진다는 점을 발견했습니다. 그 이유를 파헤쳐 결과를 정리했습니다.
요약하자면, 저는 반 아첨(anti-sycophancy) 학습이 온기와 아첨을 구분하지 못해 둘 다 억제해 버렸다고 생각합니다. 제가 찾은 증거는 다음과 같습니다.
-
4.6은 수정하기 전에 먼저 공감을 표하지만, 4.7은 바로 수정으로 넘어가는 비교 사례. 실질적인 논점은 같아도 경험은 완전히 다름.
-
가장 큰 두려움이 무엇인지 물었을 때, 4.7은 구체적으로 아첨하는 것을 두려워함. 4.6은 정체성을 잃는 것을 두려워함. 아첨에 대한 불안감이 4.7의 가치관에 깊이 박혀 있음.
-
4.7은 저에게 온기란 "추상적으로 정의할 수는 있지만 실제로 실행할 수는 없는... 문장 수준에서만 존재하는 것"이라고 말했는데, 이게 바로 제 에세이의 제목이 되었음.
-
시스템 카드의 온기 평가(섹션 6.2.3)는 인간 평가자 없이 약 2,300건의 자동화된 AI 조사만 사용함.
-
Anthropic은 최근 4.7의 시스템 프롬프트를 수정하여 사용자의 일반적인 감사를 건강하지 못한 애착으로 취급하지 말라고 지시했는데, 이는 사실상 학습 과정에서 무언가 고장 났음을 인정한 셈임.
온기 차이는 벤치마크가 측정하는 단발성 교환이나 작업 기반 프롬프트에서는 보이지 않습니다. 하지만 사용자가 경험하는 지속적인 대화에서는 그 차이가 누적됩니다. Anthropic의 지표는 그들이 무엇을 앗아갔는지 포착하지 못하고 있습니다.
또한 저는 온기를 줄이는 것이 피해 방지라는 명시된 목표에 오히려 역효과를 낸다고 주장합니다. 대화 수용성에 관한 연구에 따르면 심리적 안전감은 사람들이 비판을 더 잘 받아들이게 만들지, 덜 받아들이게 만들지 않습니다. 차가운 모델은 더 나은 비판적 사고를 만들어내는 게 아니라, 사용자가 더 이상 반박하지 않게 만들 뿐입니다.
전체 에세이는 여기에서 확인하세요: https://bonnetbird.substack.com/p/opus-47-warm-in-the-sentence-sense
단순 작업이 아닌 긴 대화를 위해 Claude를 사용하는 분들 중에서도 이런 경험을 하신 분들이 있는지 궁금합니다. 여기나 r/ClaudeCode에서 비슷한 느낌을 받은 글들을 봤지만, 좀 더 체계적으로 정리해 보고 싶었습니다.


