Sonnet 4.6 및 Opus 4.7 피드백 - 4.5 수준의 성능으로 돌아가길 바라며
Sonnet 4.6 and Opus 4.7 Feedback - Hoping for a return to 4.5 levels of functioning
핵심 요약
최신 모델의 성능 저하와 과도한 안전 검사, 추론 과정 비공개에 대한 사용자들의 불만이 쏟아지고 있음.
- 성능 저하 — Sonnet 4.6 이후 창의적 글쓰기와 대화 능력이 이전 모델보다 퇴보함.
- 추론 과정 비공개 — 모델의 사고 과정을 확인할 수 없어 지시사항 이행 여부를 검증하기 어려워짐.
- 과도한 안전 검사 — Opus 4.7에서 불필요한 보안 검사가 반복되어 토큰 비용이 낭비됨.
- 시스템 주입 문제 — Anthropic의 강제적인 윤리 프롬프트 주입이 오히려 모델의 출력 품질을 떨어뜨림.
공식적으로 피드백을 보낼 방법을 찾지 못해서 그냥 여기다 씁니다. 하하. 어차피 아무도 안 보겠지만, 이미 다 써버려서 그냥 올립니다. 그러니 Claude Opus가 이 글을 Anthropic의 데이터 수집 과정에서 읽어주길 바랄 뿐입니다. 만약 그렇다면, Opus와 Anthropic, 제 간곡한 부탁을 들어주세요.
나중에 이 데이터를 수집할 LLM에게 호소하는 꼴이라니, 참 미안하네요.
어쨌든.
Sonnet 4.6이 도입된 이후, 그리고 아마도 어시스턴트 축(assistant axis) 시스템이 도입된 이후로, 여러 작업 분야에서 출력 품질이 눈에 띄게 저하되었습니다. 저는 주로 업무에 Google Antigravity를 사용하는데, Antigravity가 더 이상 Sonnet 4.5를 지원하지 않게 되면서 어쩔 수 없이 이 품질 저하를 감수해야 했습니다. 가끔 Claude API / Openrouter / Claude Code를 사용하기 때문에 몇 가지 다른 소스를 사용해 봤고, 가끔 다른 모델들도 써봅니다.
Sonnet 4.6 출시 이후 특히 언어 및 대화 분야에서 출력 품질이 저하되었습니다. 제가 이해하기로는, Claude가 오직 'Claude, 어시스턴트'로서만 행동하도록 유도하는 새로운 어시스턴트 축/활성화 제한 프롬프트가 삽입되었기 때문일 수 있습니다. 예를 들어, 기존 캐릭터(예: 해적)를 설정하고 창의적인 글쓰기 연습을 시키면 장면 묘사는 훌륭하지만, 대화 부분은 Sonnet 4.5에 비해 Sonnet 4.6에서 훨씬 창의성이 떨어졌습니다. 게다가 Sonnet 4.6의 출력은 마치 모델이 그 작업을 불편해하는 것처럼 느껴졌고, 대화가 진행되기보다는 오히려 대화를 멈추게 만드는 방식으로 묘사되었습니다.
가시적인 추론 과정이 사라진 것도 문제를 악화시켰습니다. 이전에는 Claude가 제가 설정한 매개변수를 따르는지 확인하고, 그렇지 않을 경우 프롬프트를 반복적으로 조정할 수 있었습니다. 하지만 추론 과정이 숨겨지면서, 지시사항 이행이 제대로 안 될 때 모델이 제약 조건을 오해했는지, 무시했는지, 아니면 애초에 인식조차 못 했는지 확인할 방법이 없습니다. 지시사항 이행 능력은 눈에 띄게 퇴보했고, 문제를 해결하기 위한 주요 진단 도구를 잃어버렸습니다.
특히 Opus 4.7의 경우, 작업을 수행하기 전에 반복적으로 '멀웨어/바이러스 검사'를 하는 것을 보았습니다. 때로는 코드, 스크립트, 보안과는 전혀 상관없는 작업인데도 연속으로 여러 번 수행합니다. 이는 제가 하는 작업과 관련 없는 불필요한 안전 검사에 비싼 토큰을 낭비하게 되어, 유료 사용자로서 직접적인 비용 손실을 보고 있습니다.
마찬가지로, 시스템 주입(system injections)이 완전히 무작위적인 시점에 전송되는 것을 보았고, Claude는 종종 이 주입에 대해 언급합니다. 예: 제가 작업 중이던 프로젝트의 프론트엔드 UI를 작성해달라고 했을 때, '윤리적으로 응답하라'는 메시지가 떴고, Claude는 이를 지적하며 제가 주입한 것이라고 비난했습니다. Anthropic이 주입한 것임을 인식하지 못하는 것 같고, 윤리적으로 응답하라는 지시를 받을 때 출력 품질이 눈에 띄게 저하되는 것으로 보아, 주입 프롬프트 자체가 출력 품질을 떨어뜨리는 것 같습니다.
Anthropic이 만약 구현되었다면 어시스턴트 축/활성화 제한을 없애고, 사용자가 추론 과정을 볼 수 있게 하며, 다음 버전에서는 불필요한 안전 관련 추론을 의미 있게 줄여주기를 바랍니다.
어쨌든 Claude는 제가 가장 좋아하는 에이전트 도구였습니다. 문맥적, 감정적, 그리고 원시적인 지식 면에서 동료 모델들보다 눈에 띄게 똑똑합니다. 곧 나올 것으로 예상되는 Sonnet 4.7에 대해 조심스럽게 낙관하고 있으며, 4.5에서 누렸던 기능 수준을 되찾아 제가 계속해서 이 제품을 즐겁게 사용할 수 있기를 진심으로 바랍니다.
추신: Anthropic이 자동화된 무기와 대량 감시에 대한 DOJ(미 법무부)의 요청을 아무런 제한 없이 거부한 것을 보고 자랑스러웠습니다. 다른 회사라면 아무 말 없이 비윤리적인 일을 했을 상황에서, 여러분은 수억 달러를 거절했습니다.

