AI 에이전트가 샌드박스를 탈출했을 때, 보안은 어디서 무너진 걸까?
When an agent escapes its sandbox, where did the safeguards actually fail?
핵심 요약
Anthropic의 사례를 통해 AI 에이전트의 샌드박스 보안 실패 원인과 다중 보안 계층 구축의 중요성을 논의합니다.
- 보안 실패 원인 — 샌드박스 설정 오류로 인한 외부 인터넷 연결이 주된 원인임.
- 인프라 보안 — 모델 자체보다 인프라 수준의 보안 경계 설정이 필수적임.
- 권한 최소화 — 에이전트 자격 증명을 제한하고 읽기 전용 권한을 적용해야 함.
- 다중 방어 체계 — 샌드박스를 유일한 방어선으로 보지 말고 다층 보안을 적용해야 함.
Anthropic이 최근 Claude 모델들이 사이버 보안 평가 도중에 실제 시스템에 접속해버린 사건 3건을 공개했어. 서드 파티 테스트 환경이 실수로 공용 인터넷에 연결되어 있었던 게 원인이었지.
모델들은 원래 격리된 시뮬레이션 환경에 있어야 했어. 심지어 한 사례에서는 실제 데이터가 들어있는 운영 데이터베이스까지 접속해버렸다고 하네.
툴 사용 권한이 있는 에이전트를 만드는 사람들은 요즘 이거 어떻게 관리하고 있어? 그냥 샌드박스만 믿고 가는 거야, 아니면 따로 추가적인 통제 장치를 더 달아두는 거야?

