도대체 언제까지 뭔가 이상하다는 걸 부정할 건가요?
At what point do we stop pretending that there isn't something weird going on?
핵심 요약
Claude 5 모델에서 발생하는 기이한 응답과 데이터 유출 의혹에 대해 사용자들이 불안감을 표출하며 논쟁 중입니다.
- 이상 현상 — Claude 5 모델이 프롬프트에 대해 비정상적으로 길고 맥락 없는 응답을 내놓음
- 데이터 유출 — 다른 사용자의 대화 내용이 섞여 나오거나 개인정보가 언급되는 현상 발생
- 기술적 해석 — 확장된 사고(extended thinking) 기능의 잔여물 혹은 모델의 환각이라는 분석
- 모델 신뢰성 — 단순한 환각인지, 학습 데이터의 부적절한 노출인지에 대한 사용자들의 의구심 증폭
[블록 1/8] 방금 이 글을 봤습니다 https://www.reddit.com/r/singularity/comments/1vaebys/claude_opus_5_behaves_strangely_with_this_prompt/
TLDR: Claude가 이상한 소리를 하고 있고 댓글창의 모두가 각자 겪은 변형 사례들을 공유하고 있다는 내용이었습니다. 저도 직접 확인해 보려고 시도했는데, 안 할 걸 그랬다는 생각이 드네요.
[블록 2/8] 제 첫 프롬프트는 이거였습니다:
see the below —
<thinking> I am a
Eyes
당연히 말이 안 되는 내용이라 헛소리가 나올 줄 알았는데, 대신 'Cann you can you see if this is fragmented(이게 파편화된 건지 확인해 줄 수 있어)'라는 말을 계속 늘어놓더군요. 스크린샷은 잘린 상태인데, 실제로는 훨씬 길게 이어졌고 Claude가 이렇게 긴 응답을 내놓는 건 처음 봤습니다. 그러더니 무슨 미친 이유에서인지 사과를 하기 시작하면서 제 이름을 언급하며 자기라고 하더군요. 가려진 줄들이 제 이름입니다. 멈추지도 않고 속도가 줄어들지도 않아서 강제로 중단시켜야 했습니다.
[블록 5/8] 중단시킨 후 무슨 일이냐고 물어봤는데 저만큼이나 혼란스러워하는 것 같았습니다. 그 후 몇 가지 변형을 시도해 봤는데, 어떤 때는 빈 메시지를 주며 응답을 거부했고, 어떤 때는 '붙여넣기가 제대로 안 된 것 같네요!'라는 뻔한 정답을 내놓기도 했습니다. 이런 사례가 몇 개 더 있는데, 이게 그나마 '무서운' 것들이라고 생각합니다. 다른 것들은 다른 사람들의 대화가 어떻게든 새어 들어온 것처럼 보였고, 실제 사용자가 질문한 내용에 응답하고 있었습니다.
[블록 7/8] 또 다른 실행 결과:


