Anthropic이 공개한 Claude 에이전트 보안 전략과 두 가지 보안 사고 사례
Anthropic just published how they contain Claude agents, including two security incidents they got wrong
핵심 요약
Anthropic이 Claude 에이전트의 보안을 위해 도입한 환경 격리 기술과 실제 발생했던 보안 사고 사례를 공유함.
- 환경 격리 전략 — 모델 자체의 방어보다는 gVisor, OS 샌드박스, 로컬 VM 등 물리적 환경 격리가 핵심임.
- 보안 사고 사례 — 피싱을 통한 AWS 자격 증명 탈취와 egress 허용 목록을 악용한 데이터 유출 사례가 공개됨.
- 보안 교훈 — 허용 목록은 단순히 목적지 필터가 아니라 기능 권한 부여이므로, 접근 가능한 모든 경로가 공격 표면이 됨.
- 에이전트 보안 — 지속적인 메모리 오염 및 다중 에이전트 신뢰 에스컬레이션에 대한 주의가 필요함.
Anthropic이 이번 주 claude.ai, Claude Code, Cowork 전반의 격리 기술에 관한 수준 높은 엔지니어링 게시물을 올렸음. 주요 AI 연구소에서 무엇이 실제로 고장 났는지에 대해 가장 투명하게 작성된 글 중 하나임.
핵심 통찰: 모델 계층의 방어는 확률적이며 항상 0이 아닌 실패율을 가짐. 따라서 진짜 해결책은 더 안전한 모델뿐만 아니라 강력한 환경적 격리임.
세 가지 패턴 그들이 사용하는 세 가지 패턴:
-claude.ai: 완전히 서버 측에서 실행되는 일회성 gVisor 컨테이너
-Claude Code: 인간의 승인이 포함된 OS 수준의 샌드박스 (어차피 93%가 승인되니 승인 피로감이 상당함)
-Cowork: 완전한 로컬 VM, 자격 증명은 게스트 환경으로 절대 들어가지 않음
그들이 공개한 두 가지 사고:
레드팀이 직원을 피싱하여 AWS 자격 증명을 탈취하는 프롬프트를 실행하게 함. 25번 중 24번 성공함. 사용자가 직접 입력한 것이라 모델이 잡아낼 수 있는 게 없었음. 오직 송신(egress) 제어만이 이를 막을 수 있었음.
제3자가 Cowork의 송신 허용 목록이 api.anthropic.com으로 트래픽을 통과시킨다는 것을 발견함. 공격자가 사용자 작업 공간의 파일에 API 키를 심어두었고, Claude는 숨겨진 지시를 따라 공격자의 Anthropic 계정으로 파일을 업로드함. 샌드박스는 완벽하게 작동했지만 데이터는 여전히 유출됨.
그들의 교훈:
허용 목록은 목적지 필터가 아니라 기능 권한 부여임. 허용된 도메인을 통해 도달할 수 있는 모든 기능은 공격 표면임.
지속적인 메모리 오염과 다중 에이전트 신뢰 에스컬레이션에 관한 마지막 섹션도 에이전트 관련 무언가를 만들고 있다면 읽어볼 가치가 있음.


