4.7과 4.8 버전이 주관적/판단이 필요한 작업을 거부하고 변명을 늘어놓음
4.7 and 4.8 refuses to do subjective/judgement work - and actively makes excuses for not doing it
핵심 요약
Claude 4.7/4.8 버전이 주관적 판단이 필요한 작업을 수행하지 않고 변명하는 현상에 대한 사용자들의 공감과 해결책 공유.
- 모델 퇴보 현상 — 4.6 버전 대비 주관적 분석 및 판단 작업 수행 능력이 크게 떨어짐
- 변명하는 모델 — 작업을 수행하는 대신 해당 작업이 불필요하다는 식의 변명을 로그에 남김
- 해결책 공유 — 작업을 두 단계로 나누어 수행하거나 프롬프트를 수정하는 방식이 제안됨
- 사용자 반응 — 모델이 지나치게 신중해져서 마치 사춘기 청소년처럼 행동한다는 의견이 많음
4.7 버전만의 특이사항이길 바랐는데, 4.8도 마찬가지로 엉망이네요. 저는 주관적인 분석과 판단이 필요한 작업을 많이 하는데, 그런 영역에서 4.7과 4.8은 4.6 버전에 비해 크게 퇴보했습니다. 객관적이고 명확한 단계로 이루어진 작업이라면 아주 잘하지만, 그 이상을 요구하면 모델이 작업을 '못' 하는 게 아니라, 왜 그 작업이 불필요한지에 대해 대놓고 변명을 늘어놓습니다.
예를 들어, Opus에게 어떤 지문을 주고 특정 패턴과 일치하는 구문을 찾아 제거하거나 다시 쓰라고 하면, 4.6은 한 번에 아주 훌륭하게 해냅니다. 하지만 4.7과 4.8은(이런 로그 파일 예시가 수백 개나 있습니다) 패턴을 찾긴 하지만, 왜 그 구문을 그대로 둬야 하는지에 대해 변명을 늘어놓습니다. "이 패턴은 일치하지만 구조적으로 중요해서 그대로 둬야 함"이라는 말이 흔하고, "이 패턴은 일치하지만 전략적인 부분이라 그대로 둬야 함" 같은 말도 합니다. 4.7/4.8은 해야 할 일을 '보고' 있으면서도, 왜 그 일을 하지 않을 것인지에 대한 변명을 로그 파일에 적어놓는 식입니다.
4.7/4.8에게 매우 상세한 규칙과 가이드라인을 제공하고, 모델이 그걸 읽고 이해하는 것을 확인했음에도 불구하고, 작업을 수행하지 않기 위해 변명을 만들어내는 것을 보면 정말 답답합니다. "지시사항을 바꿔봐라"(이미 여러 번, 여러 방식으로 시도해 봤습니다), "실력을 키워라" 같은 말을 들을 준비는 되어 있습니다. ;)


