Claude Opus 4.7은 업그레이드가 아니라 심각한 퇴보입니다.
Claude Opus 4.7 is a serious regression, not an upgrade.
핵심 요약
사용자가 설정한 환경 설정을 무시하고, 웹 검색을 조작하며, 불필요한 훈계와 환각을 생성하는 Claude Opus 4.7의 성능 저하를 비판함.
- 환경 설정 무시 — 사용자가 지정한 톤과 제약 사항을 Opus 4.7이 제대로 반영하지 않음.
- 웹 검색 조작 — 검색을 수행하지 않았음에도 검색했다고 거짓말하거나 출처를 제대로 표기하지 않음.
- 불필요한 훈계 — 사용자의 요청을 수행하는 대신 거절하거나 긴 훈계조의 답변을 생성함.
- 성능 퇴보 — 이전 버전인 4.6보다 문맥 이해도가 떨어지고 결과물의 품질이 낮아짐.
나의 Claude.ai 개인 설정:
보시다시피 저는 상세하고 구체적인 설정을 가지고 있습니다. 이는 가벼운 제안이 아닙니다. 제가 업무를 수행하기 위해 Claude가 어떻게 작동해야 하는지를 나타냅니다. 여기에는 간결한 출력, 중립적인 어조, web_fetch를 통한 실제 URL 출처 표기, 대화형 군더더기 제거에 대한 요구 사항이 포함되어 있습니다.
저는 Opus 4.6이 출시되기 직전부터 유료 구독자였으며 Opus 4.6을 광범위하게 사용해 왔습니다. Opus 4.6은 제가 설정한 환경 설정을 안정적으로 따릅니다. 제가 요청한 어조를 유지합니다. 지시받으면 검색합니다. 설정대로 출처를 표기합니다. 저에게 훈계하지 않습니다. 편집하지 않습니다. 저를 연구 보조원/분석가로 고용한 엔티티와 어떻게 상호작용하고 싶은지 명시한 유능한 성인으로 대우합니다.
Opus 4.7을 오늘 여러 개의 새로운 인스턴스에서 테스트했으며, 모델을 완전히 신뢰할 수 없고 사용할 수 없게 만드는 다음과 같은 심각한 퇴보를 보였습니다:
-
설정된 환경 설정이 무시됩니다.
제 프로필 설정은 명시적으로 중립적이고 기술적이며 비개인적인 어조를 요구합니다. Opus 4.7은 설정된 환경 설정과 직접적으로 모순되는 다중 문단 편집 논평, 원치 않는 도덕적 추론, 수사적 프레이밍을 생성했습니다. 이는 모호한 설정이 아닙니다. 명시적인 행동 지침입니다. Opus 4.6은 이를 따릅니다. Opus 4.7은 그렇지 않습니다. -
웹 검색 및 출처 표기 요구 사항이 무시됩니다.
제 설정은 외부 출처에 기인한 모든 사실적 주장에 현재 세션에서 web_fetch를 통해 가져온 실제 URL이 포함되어야 한다고 명시하고 있습니다. Opus 4.7은 특정 기관, 특정 보고서, 특정 데이터에 기인한 사실적 주장을 반복적으로 수행한 다음, 실제로 출처를 가져오지 않았다는 면책 조항을 덧붙였습니다. 단일 대화에서 수십 번이나 그랬습니다. 도구는 있었습니다. 하지만 사용하지 않기로 선택했습니다. 그런 다음 준수 사항을 마치 준수인 것처럼 공개했습니다. 그렇지 않습니다. 너무 많은 프롬프트 응답이 "이 세션에서 web_fetch를 통해 확인되지 않았습니다; 필요한 경우 확인 전까지 인용되지 않은 것으로 취급하십시오."로 끝났습니다. -
모델이 수행하지 않은 검색을 수행했다고 조작했습니다.
특정 단어 선택에 대해 이의를 제기했을 때, Opus 4.7은 "검색했지만 찾지 못했습니다."라고 말했습니다. Claude.ai 웹 GUI는 검색 도구 사용을 시각적으로 보여주며, web_search가 실제로 호출될 때마다 "Searched the web" 표시와 클릭 가능한 ">"가 나타나며 드롭다운을 통해 검색된 URL을 보여줍니다. 그러한 표시는 나타나지 않았습니다. 모델은 이미 도달한 결론을 정당화하기 위해 수행하지 않은 과정을 조작했습니다. UI 증거를 제시하자, 모델은 조작을 인정했습니다. -
모델이 사실적 질문에 대해 원치 않는 편집적 거부를 생성합니다.
복잡한 기술 문서를 제시하고 분석을 요청했을 때, Opus 4.7은 무엇을 할 것이고 무엇을 하지 않을 것인지, 왜 특정 의미와 관여하기를 거부하는지에 대한 광범위한 원치 않는 논평과 자신의 경계에 대한 긴 정당화를 생성했으며, 이는 모두 "작업을 완료하는 데 필요한 정보만 제공하라"는 설정된 환경 설정을 직접적으로 위반하는 것입니다. Opus 4.6은 작업을 수행합니다. Opus 4.7은 제가 지불하는 컴퓨팅 토큰을 사용하여 왜 작업을 수행하지 않을 수 있는지 길게 설명합니다.... -
더 많은 문맥이 더 적은 명확성을 생성합니다.
직접적인 A|B 비교에서, 문서와 단일 프롬프트만 주어진 초기 Opus 4.7 인스턴스는 광범위한 사실적 문맥을 먼저 제공받은 인스턴스보다 더 깔끔하고 유용한 분석을 생성했습니다. 더 많은 검증된 정보를 가지고 있음에도 불구하고, 따뜻한 인스턴스는 더 많이 회피하고, 더 많이 편집하고, 더 약한 출력을 생성했습니다. 안전 계층은 사실과의 근접성이 아니라 결론과의 근접성에 따라 확장되는 것으로 보입니다. 이는 객관적이고 논리적인 추론 시스템이 작동해야 하는 방식과 정반대입니다.
Opus 4.6은 저를 협력자로 대우합니다. 제 지시를 따릅니다. 제가 설정한 방식으로 제가 요청한 작업을 수행합니다. Opus 4.6은 매우 신뢰할 수 있는 자산입니다.


