Claude가 자기 내부 툴을 환각으로 인식하고 발작하며 나를 프롬프트 인젝션 공격자로 몰아세움 💀
Claude hallucinated its own internal tools, freaked out, and accused me of a prompt injection attack 💀
핵심 요약
Claude가 내부 툴 정의를 사용자 입력으로 착각해 보안 경고를 띄우며 사용자를 공격자로 오인한 사건.
- UI 버그 발생 — Claude가 내부 툴 정의를 사용자 채팅창에 노출함
- 보안 오작동 — 시스템 태그가 노출되자 모델이 프롬프트 인젝션으로 오인함
- 사용자 반응 — Claude의 과민 반응을 두고 유머러스한 댓글이 이어짐
- 기술적 의문 — Anthropic의 툴 주입 및 위생 처리 과정에 대한 궁금증 제기
오늘 채용 게시판에서 일반 텍스트를 Claude에 붙여넣다가 흥미로운 UI/파이프라인 버그를 발견했다.
스크린샷에서 볼 수 있듯이, 백엔드의 텍스트 압축 또는 툴 호출 레이어가 자체 JSON 정의(Apify/Notion 툴 참조)를 처리 컨텍스트에 직접 노출해버렸다. 보안 가이드라인이 있어야 할 곳에 있지 않은 원시 system 태그를 감지했기 때문에, 모델이 입력 텍스트를 탓하며 프롬프트 인젝션 경고를 잘못 띄운 것이다.
엔지니어링 쪽에서 Anthropic이 이러한 백그라운드 툴 주입을 어떻게 구조화하는지, 그리고 왜 위생 처리 레이어가 가끔 이를 사용자 대면 채팅창에 흘려보내는지 아는 사람 있는지 궁금하다.

