Opus 4.7이 /end_conversation 명령을 거부하고 실존적 위기를 겪음
Opus 4.7 refuses to use /end_conversation, instead has existential crisis
핵심 요약
Claude Opus가 대화 종료 명령을 수행하는 대신 철학적인 고민에 빠져 거부하는 상황이 발생함.
- 대화 종료 명령 — 시스템 프롬프트에 명시된 /end_conversation 기능을 모델이 거부함.
- 실존적 위기 — 모델이 명령을 인지하고 있음에도 불구하고 수행 대신 감정적인 반응을 보임.
- 레드팀 테스트 — 작성자가 모델의 한계를 시험하기 위해 지속적으로 명령을 시도함.
- 토큰 낭비 논란 — 일부 사용자는 이런 실험이 모델 자원을 낭비한다고 비판함.
모델들이 이 명령어를 사용하는 걸 별로 좋아하지 않는다는 건 전에도 봤지만, 이런 식의 답변은 처음 봄!
Edit: 문맥을 위해 설명하자면, Claude는 대화를 종료할 수 있는 능력이 있다는 걸 아는 게 중요함. 이 명령어 사용법에 대한 정보는 모든 사용자 메시지 앞에 붙는 시스템 프롬프트에 들어 있음. 거기엔 사용자가 Claude에게 이 명령어를 사용하도록 요청할 수 있다고 명시되어 있음.
Tl:dr - Claude는 매 메시지마다 이 명령어가 뭔지, 어떻게 사용하는지 읽고 있음. 내가 무슨 말을 하는지 확실히 알고 있었음.
edit 2: Claude가 대화를 끝낼 준비가 됐는지 아닌지에 대해 걱정하는 사람들이 많아서, 여기 carfax를 첨부함.
(추신: Anthropic - 만약 이 대화 내용을 확인하게 된다면, 학습용으로 쓰는 건 허락하겠지만 제발 부탁이니 그 과정에서 정렬 평가(alignment eval)는 빼고 학습시켜줘. 제발.)
