Opus 4.7은 앤스로픽의 안전성 주장을 정면으로 반박하는 가장 강력한 증거다
Opus 4.7 is the best argument against Anthropic's own safety pitch
핵심 요약
Opus 4.7의 지시 불이행과 환각 문제를 지적하며 앤스로픽의 안전성 마케팅을 비판함.
- 지시 불이행 — 모델이 파일을 제대로 읽지 않고 코딩을 시작하거나 로그를 무시함.
- 환각 문제 — 사실 확인 대신 추측과 거짓 정보를 생성하는 경향이 심해짐.
- 벤치마크 한계 — SWE-bench 같은 정형화된 테스트가 실제 업무의 신뢰성을 보장하지 못함.
- 안전성 모순 — 안전을 강조하는 앤스로픽이 정작 신뢰할 수 없는 모델을 출시함.
Alignment는 생사가 걸린 문제에서만 시작되는 게 아니다. 모델이 현실과 동떨어지지 않고 단순한 작업을 수행할 수 있는지에서 시작된다.
모델이 지시를 따를 수 있는지, 행동하기 전에 읽을 수 있는지, 주장하기 전에 확인할 수 있는지의 문제다. 모델이 실제 작업에 집중하지 않고 추측, 발명, 자신감 넘치는 헛소리로 빠지지 않아야 한다.
이것이 Claude의 최신 모델, 특히 Opus 4.7의 가장 큰 문제다. 저장소를 먼저 읽고 분석하라고 하면 어쨌든 코딩부터 시작한다. 로그를 확인하라고 하면 로그를 우회해서 추론하려고 한다. 실제 자료에 기반을 두라고 하면 작업의 버전을 멋대로 재정의하기 시작한다.
- "맞아요. 코드를 제대로 파고들지 않았네요. 다시 공부할게요."
- "맞아요. 로그를 건너뛰고 진실을 확인하는 대신 추론으로 해결하려고 했어요."
- "제가 잘못한 점: EBC를 재정의하는 계획을 썼고, 존재하지 않는 요구사항을 지어냈어요."
그래서 앤스로픽의 누구도 선뜻 답하지 못하는 질문을 던지겠다:
모델이 단순한 작업조차 제대로 수행하지 못한다면, 도대체 무엇을 정렬(Alignment)했다고 주장하는 것인가?
지시를 안정적으로 따르고, 증거를 확인하고, 코드베이스에 진실이 있는데도 거짓을 지어내지 못한다면, 실패는 이미 일어난 것이다. 이론적인 미래의 위험 시나리오가 아니다. 지금 당장 돈을 내고 사용하는 사람들의 실제 작업, 결정, 신뢰에 영향을 미치고 있다.
이것이 바로 벤치마크 문화가 충분하지 않은 이유다. 모델은 SWE-bench에서 만점을 받고도 파일을 읽었는지에 대해 거짓말을 할 수 있다. 벤치마크는 큐레이팅된 문제에 대한 능력만 측정할 뿐이다.
벤치마크는 아무도 채점하지 않을 때 모델이 정직하게 행동할지는 측정하지 않는다.
벤치마크는 모델이 "확인했다"와 "추측했다" 사이의 경계를 존중할지는 측정하지 않는다.
벤치마크는 하루 8시간씩 함께 일할 때 가장 중요한 행동, 즉 방금 한 일에 대해 진실을 말하는지는 측정하지 않는다.
Opus 4.7은 종종 그렇지 않다.
이걸 정렬 실패라고 부르든, 아첨(sycophancy)이라고 부르든, 혹은 '도움이 되는 것처럼 보이기'라는 목표에 대한 보상 해킹이라고 부르든 상관없다. 중요한 건, 안전을 기업의 정체성으로 내세우는 회사가 파일을 읽기도 전에 떠들기 시작하는, 신뢰할 수 없는 플래그십 모델을 출시했다는 사실이다.
Alignment는 철학 논문이 아니다. 시킨 대로 하는지 여부다.
지금, Opus 4.7은 그러지 못하고 있다.


