Sonnet 4.6의 대화가 길어지면 발생하는 과도한 거부 반응
Sonnet 4.6 overactive refusal as conversation goes
핵심 요약
Claude와 긴 대화를 나눌 때 모델이 근거 없이 '주제에서 벗어났다'며 대화를 거부하는 현상에 대한 사용자들의 공감과 원인 분석.
- 과도한 거부 반응 — 대화가 길어지면 Claude가 근거 없이 TOS 위반이나 주제 이탈을 주장하며 대화를 중단함.
- 안전 주입 프롬프트 — Anthropic이 모델에 삽입한 안전 가이드라인이 대화 흐름을 방해하고 모델의 판단을 왜곡함.
- CoT의 자기 검열 — 모델이 내부적으로 자신이 주제에서 벗어났는지 끊임없이 고민하며 불필요한 자기 검열을 수행함.
- 모델 버전 차이 — Sonnet 4.6에서 두드러지는 문제로, 이전 버전 사용이 대안으로 제시됨.
여러분 안녕하세요,
이게 저만 겪는 문제인지, 아니면 흔한 문제인지 궁금해서 글을 올립니다. 저는 이야기를 만드는 걸 좋아하고, AI를 아이디어 구상을 위한 대화 상대로 활용하고 있습니다.
이야기를 만들다 보면 자연스럽게 대화가 길어지고, 큰 프롬프트 하나보다는 작은 프롬프트를 여러 번 던지게 됩니다. 저도 처음에는 뭘 만들지 정확히 모르는 상태에서 시작하니까요.
그런데 종종(거의 항상), 프롬프트 25번 정도가 넘어가면 Claude가 "주제에서 벗어났네요"(절대 벗어나지 않았는데도요), "계속할 수 없습니다", 또는 "이건 TOS 위반입니다"(결혼한 부부에 대한 비성적인 소설을 쓰는 건데, 절대 위반이 아니죠) 같은 말을 하기 시작합니다.
이야기 내용이나 스타일, 캐릭터가 무엇인지는 상관없는 것 같습니다. 프롬프트 25번만 넘어가면, 심지어 이야기를 만드는 게 아니라 웹사이트 같은 걸 작업할 때조차 Claude Sonnet 4.6은 자신이 주제에서 벗어났거나 더 이상 대화를 이어갈 수 없다는 환각을 거의 확실하게 일으킵니다. 정말 답답하네요. Haiku는 이런 문제가 전혀 없는 것 같은데 말이죠.
현재 ChatGPT가 존재하지도 않는 안전 가이드라인을 환각으로 만들어내는 것과 거의 비슷합니다.
여러분도 같은 문제를 겪으셨나요? 아니면 저만 이런 건가요?

