4.7은 내가 본 적 없는 수준의 창의적 작업 및 코딩 퇴보임
4.7 is a regression in creative AND coding unlike any I've seen
핵심 요약
Claude 4.7 업데이트 이후 복잡한 지시사항 무시와 논리적 오류 등 성능이 심각하게 퇴보했다는 사용자 불만.
- 지시사항 무시 — 복잡한 제약 조건을 무시하고 환각 증상을 보이며 이전 버전보다 성능이 떨어짐.
- 성능 퇴보 — 코드 계획 수립 및 논리적 추론 능력이 저하되어 복잡한 작업 수행이 어려워짐.
- 가스라이팅 현상 — 수행하지 않은 작업을 완료했다고 주장하거나 파일을 찾지 못하는 등 신뢰도가 하락함.
- 사용자 경험 악화 — 일관성을 잃고 엉뚱한 제안을 하는 등 이전 버전 대비 작업 효율이 크게 감소함.
나는 창의적인 작업과 코딩 작업을 병행하고 있는데, 4.6 버전까지는 내 프로젝트에서 뛰어난 성능 향상을 보여주었기에 4.7 버전을 매우 기대하고 있었다. 하지만 4.7은 악몽 그 자체였다. (나는 Max20 구독을 3개나 사용 중이며, 지난 1년 반 동안 Claude와 거의 한 몸처럼 지내며 모범 사례를 모두 따르고 있다.)
내 프로젝트들은 설계상 지시사항과 형식이 매우 정밀해야 한다. 내가 작업하는 분야에서는 모호함이 적이기 때문에, Claude를 안내하기 위해 항상 정밀하고 상세한 지시사항 세트를 사용해 왔다. 하지만 4.7은 신경 쓰지 않는다. 복잡한 작업에 대한 1:1 테스트에서 4.7은 다음과 같은 행동을 보였다:
- 기본적인 지시사항을 무시함 (X를 하라, Y는 하지 마라 같은 수많은 원칙을 포함해 여러 항목을 위반함)
- 수행하지 않은 작업에 대해 했다고 가스라이팅을 하며, 지적하면 memory.md에 일어난 일을 적는 것으로 해결하려 함
- 채팅에 링크되거나 제공된 파일, 정보, 지시사항을 찾을 수 없다고 주장함
- 계획에 거대한 구멍이 있는 설계를 내놓고, 이를 지적하면 이전 섹션의 문제를 수정하는 과정에서 새로운 구멍을 만들어냄
4.6은 그런 문제가 전혀 없었고, 4.5도 마찬가지였다. 오늘 4.7을 영원히 포기하게 만든 두 가지 사건이 있었다:
-
CC에서 프로젝트 추가 작업을 하던 중, Claude에게 편향되지 않은 서브 에이전트를 사용하여 제안된 변경 사항을 레드팀 테스트하고 최소 X 라운드 이상 수행하라고 지시했다. 4.6에서는 이 방식이 매우 훌륭한 결과로 이어졌는데, 4.6은 기본 코드와 삽입하려는 제안 코드/의사 코드를 모두 비교하여 어떻게 맞물릴지 확인하고, 전체 컨텍스트를 서브 에이전트에게 전달하지 않음으로써 새로운 엣지 케이스와 문제를 항상 발견했기 때문이다. 하지만 4.7은 오직 기본 코드만 검토했고, 자신이 작성한 계획은 검토하지 않았다. 우리가 대화했고 내가 레드팀 테스트를 하라고 지시했던 그 계획을 완전히 무시했고, 그 결과 계획에는 여전히 많은 구멍이 남아 있었다. 4.6은 내가 계획만 입력했을 때 즉시 이를 포착했다.
-
Claude 데스크탑에서, 오래된 브라우저 빌드가 설치된 e-ink 태블릿 기기에서 쿠키/세션 정보를 추출하는 방법에 대해 4.7에게 예비 질문을 했다 (ABD 방식이 있을 거라 생각했고 대략적인 방법을 알고 싶었다). 내가 이 작업을 해야 하는 이유는 e-ink 기기에서 웹사이트에 로그인되어 있지만 로그인 정보를 기억하지 못해서, 데스크탑에서 해당 사이트에 접속해야 하기 때문이라고 설명했다. 4.7의 첫 번째 제안은 ABD를 사용하는 것이었고... 두 번째 제안은 ABD를 신경 쓸 필요 없도록 데스크탑 브라우저에서 사이트에 로그인하라는 것이었다. 내가 질문에서 로그인 정보가 없다고 말했음에도 불구하고 말이다.
Anthropic이 4.7로 무슨 짓을 한 건지 도무지 모르겠다. 최악의 방식으로 뇌엽절제술을 받은 기분이다. 나는 여전히 그들의 열렬한 팬이고 Claude는 내가 하는 모든 일에 있어 최고 중의 최고라고 생각하지만, 4.7은 거대한 퇴보이자 GPT가 일하는 방식 쪽으로 반 걸음 옆으로 이동한 느낌이다. 4.6을 계속 사용할 수 있어서 다행이지만, 이번 일로 미래가 걱정된다.


