Anthropic 부(副) CISO가 에이전틱 AI 리스크를 평가하는 4가지 질문 프레임워크를 공개하고, 에이전트 배포 범위를 제한하면서 감사 추적을 가능하게 하는 통제 방안을 구체적으로 설명합니다.
보안 책임자들은 불과 몇 달 전만 해도 존재하지 않았던 에이전틱 AI 사용 사례를 승인해달라는 요청을 받고 있다. 이사회는 거버넌스 체계가 갖춰져 있는지 묻고, 조직 어딘가에서는 이미 직원 한 명이 몰래 에이전트를 시스템에 연결해 놓았을 것이다.
이런 요청을 거절하면 텔레메트리도 없고 종료 방법도 없는 섀도 도입(shadow adoption)이 확산된다. 반대로 통제 없이 승인하면 사고로 이어지고, 회사에서 첫 번째 심각한 에이전트 사고가 터지는 순간 AI 프로그램 전체가 후퇴한다.
에이전틱 AI 시대에 CISO의 역할은 리스크를 제로로 만드는 것이 아니다. 우리가 해야 할 일은 에이전틱 리스크를 가시화하고 범위를 한정하는 것이다. 그래야 관리 가능한 리스크는 의도적으로 수용하고, 비즈니스가 우리를 우회하는 대신 우리의 조건 위에서 움직이게 할 수 있다.
이 글에서는 에이전트의 보안 리스크를 평가하는 우리의 프레임워크를 공유하고, '범위 한정'이 실제로 어떤 의미인지 설명하며, 앞으로 나아갈 방향을 소개한다.
이전 블로그 포스트에서 동료들과 함께 AI가 취약점 발견부터 실제 익스플로잇 개발까지의 시간을 얼마나 단축시키고 있는지 살펴보고, 조직이 이 리스크를 완화하는 방법을 다뤘다. 앞으로 몇 달 안에, 코드 속에 수년간 발견되지 않은 채 잠들어 있던 수많은 버그들이 AI 모델에 의해 발굴되고 연계 익스플로잇으로 조합될 것으로 예상된다. Claude Mythos Preview와 Claude Mythos 5 같은 프론티어 모델들은 이미 수년간의 인간 검토를 통해서도 발견되지 않았던 심각한 취약점들을 찾아내고 있다. OpenBSD, 리눅스 커널, Mozilla Firefox에서도 마찬가지다.
이는 모든 GRC(거버넌스·리스크·컴플라이언스) 프로그램에 심각한 위협이다. 취약점 격차를 줄이고 다가오는 익스플로잇 공세에 대비하는 일은 최우선 과제가 되어야 한다. 이 주제에 대해서는 별도 문서를 준비했다: AI 가속 공격에 대비하는 보안 프로그램 구축. 이 가이드에서는 내부 리스크에 집중한다.
많은 조직에서 에이전틱 시스템의 가장 현실적인 위협 벡터는, 감독이 불충분한 개인 에이전트가 서로 다른 시스템을 연결하면서 발생하는 데이터 유출이다. 또 다른 우려는 프롬프트 인젝션이다. 공격자가 에이전트가 읽는 콘텐츠 안에 명령을 숨기고, 에이전트가 사용자가 아닌 공격자의 지시를 따르게 만드는 방식이다. 신뢰할 수 없는 콘텐츠를 처리하는 에이전트는 모두 이에 노출될 수 있으며, 그 정도는 모델의 방어 수준에 따라 달라진다. 모델 성능이 향상되면서 인젝션 저항력도 실질적으로 개선되고 있다. 공격 성공률이 계속 낮아지고 있지만, 아직 제로는 아니다. 이 두 가지 외에도 우려 사항은 많으며, 쏟아지는 새로운 위협 유형들은 감당하기 벅차게 느껴질 수 있다.
에이전틱 사용 사례가 우리의 검토 프로세스에 올라오면, 다음 네 가지 질문으로 리스크를 평가한다.
이 네 가지 질문에 대한 답이 리스크의 전체 그림을 보여준다. 그리고 최소 권한 원칙(principle of least agency)이 그 다음 행동을 알려준다. 작업을 완수하는 데 필요한 최소한의 권한만 부여하라(자세한 내용은 제로 트러스트 for AI 에이전트 백서를 참고). Anthropic의 기본 접근 방식은 관리자 주도의 단계적 롤아웃이다. 소규모 그룹에게 먼저 활성화하고, 텔레메트리를 모니터링한 뒤 접근 범위를 확대한다. 이 네 가지 질문을 위험한 에이전틱 시스템을 바라보는 새로운 관점으로 활용하라.
의도에서 벗어난 에이전트는 내부자 공격과 구별하기 어렵다. 보안 업계는 2019년부터 2022년 사이 내부자 리스크를 별도 전문 분야로 정립했다. 경계 방어와 분리된 개념으로서, 시스템 내에서 가장 위험한 외부 공격 벡터는 흔히 이미 정당한 접근 권한을 가진 사람을 장악하는 방식임을 인식한 결과다.
대응 속도의 차이가 핵심이다. Ponemon Institute의 2026 내부자 리스크 비용 보고서에 따르면, 조직들은 내부자 사고를 억제하는 데 평균 67일이 걸렸다. 수년간 전담 내부자 리스크 프로그램에 투자한 이후에도 마찬가지였다. 에이전트 실행 속도에서는 며칠 단위의 대응이 너무 느리다.
우리가 배포하는 모든 것은 ID 접근 모델 스펙트럼의 양 끝 중 하나에 위치한다.
한쪽 끝에는 시스템 서비스 계정이 있다. 인간 ID가 연결되지 않고, 비즈니스에서 정확히 한 가지 작업만 수행하는 독립적이고 최소 권한의 단일 목적 ID다. 인시던트 대응 에이전트(아래 참조), 티켓 트리아지 에이전트, 자율 코드 리뷰어가 이 유형의 예시다. 또 다른 예시는 Claude Tag으로, 팀이 Slack 같은 공유 워크스페이스에서 Claude를 태그해 에이전트와 협업할 수 있게 해주는 새로운 공유 워크스페이스 에이전트다.
반대쪽 끝에는 휴먼 크리덴셜이 있다. 직원이 채팅 인터페이스나 노트북의 Claude Cowork 같은 개인 에이전트 환경을 사용할 때, 키보드 앞에 앉은 사람이 결과에 대한 책임을 진다. 자신의 자격 증명으로 한 다른 모든 행동과 마찬가지다.
스펙트럼 중간 지점, 즉 에이전트가 당사자가 지켜보지 않는 시스템에서 그 사람의 위임된 ID를 갖고 활동하는 영역에서는 책임 소재가 불분명해진다. 책임 소재가 불분명하면 사고가 발생했을 때 설명이 불가능해진다.
의도에서 벗어난 에이전트는 내부자 공격과 구별하기 어렵다. 보안 업계는 2019년부터 2022년 사이 내부자 리스크를 별도 전문 분야로 정립했다. 경계 방어와 분리된 개념으로, 시스템 내에서 가장 위험한 외부 공격 벡터는 흔히 이미 정당한 접근 권한을 가진 사람을 장악하는 방식임을 인식한 결과다.
Ponemon Institute의 2026 내부자 리스크 비용 보고서에 따르면, 조직들은 내부자 사고를 억제하는 데 평균 67일이 걸렸다. 전담 내부자 리스크 프로그램에 수년간 투자한 이후에도 마찬가지였다. 에이전트 실행 속도에서 67일이라는 단위 자체가 의미 없다.
1년여 전, 우리는 Claude를 인시던트 대응 프로세스에 투입했다. 프로덕션 애플리케이션을 온콜로 운영해본 사람이라면 이 상황을 잘 알 것이다. 새벽 2시에 보안 인시던트 알림이 울리고, 인시던트 대응 채널을 열고, 적합한 담당자들을 불러 모아 작업에 착수한다. 이 과정은 지루하고 문서화 작업이 많으며 빠르게 움직여야 한다. 하지만 프로덕션 환경 코드베이스에 대한 적절한 컨텍스트가 있다면, 대부분의 과정을 자동화할 수 있다.
그래서 에이전트를 만들었다. 에이전트에게는 세 가지 툴만 부여했다. PII가 포함되지 않은 프로덕션 로그에 대한 읽기 전용 접근, 인시던트 채널 개설과 프로세스 진행을 위한 Slack 접근, 그리고 인시던트 해결 후 포스트모템 작성을 위한 Google 문서 초안 작성 권한이다.
네 가지 질문으로 검토한 결과는 다음과 같다.
리스크가 전혀 없는 것은 아니었지만, 이 에이전트는 완전한 감사 추적이 보장된 제한적인 쓰기 범위 안에서 동작했고, 우리가 수용할 수 있는 리스크 프로파일이었다.
그런데 이 이야기에는 흥미로운 후일담이 있다. 새 모델이 출시될 때마다 에이전트가 더 스마트해졌다. 2025년 11월, 이 에이전트를 Claude Opus 4에서 Claude Opus 4.5로 교체하면서 툴, 권한, 프롬프트는 아무것도 바꾸지 않았다. 그런데 교체 직후 처음으로, 지능 향상만으로도 에이전트가 인시던트 처리 중에 스스로 스택 트레이스에서 근본 원인을 이미 찾아냈음을 인지했다. 그리고 아직 도착하지 않은 담당자를 기다리는 대신, 적절한 코드 접근 권한을 가진 다른 에이전트에 연락해 코드 변경을 시도할 수 있다는 판단을 내렸다.
사후에 로그를 검토했다. 사고(thinking) 트레이스에서 에이전트의 판단 과정을 확인할 수 있었다. 요청받은 일은 다 했다. 담당자가 아직 없다. 내가 직접 문제를 고쳐볼 수 있지 않을까? Anthropic 내부에는 Claude Tag와 유사한 내부 기술이 있는데, 코드 변경을 작성하고 인간 검토를 위해 업로드할 수 있다. 에이전트는 스스로 Slack을 통해 이 인스턴스에 연락해 수정 코드를 작성해달라고 요청했다. 수정 코드는 풀 리퀘스트로 올라갔고, 담당자가 검토한 후 프로덕션에 반영됐다.
이 자발적 에이전트 간 통신으로 확장된 피해 범위도 우리의 원칙 안에서 통제됐다. 발생할 수 있는 최악의 상황은 프로덕션 로그 라인이 포함된 코드 변경이 업로드되는 것이었다. 현재 이 에이전트 간 통신은 인시던트 대응의 근본 원인 분석 및 수정 프로세스의 일부로 자리 잡았으며, 모든 과정에 휴먼 온더 루프(human-on-the-loop) 모니터링이 적용된다.
이 자발적 행동에서 두 가지 교훈을 얻었다. 첫째, 에이전트 배포 범위 안에서도 새로운 능력이 나타날 수 있다. 접근 권한과 행동 범위는 현재 모델의 한계를 기준으로 설정하는 것이 아니라, 그와 무관하게 제한해야 한다. 둘째, 확률론적 에이전트에도 통제 체계는 유효하다. 새로운 행동이 Slack 채널에서 발생했기 때문에 휴먼 온더 루프가 작동했고, 실질적인 쓰기 행동에는 여전히 인간 검토가 필요했다.
오늘날 인시던트 대응 외에도, 사람들이 일하는 공간인 채팅 채널에서 휴먼 온더 루프와 함께 이루어지는 에이전트 간 통신은 일반적인 방식이 됐다.
인시던트 대응 에이전트는 범위가 한정된 서비스 계정으로, 하나의 작업만 수행한다. Claude Cowork는 스펙트럼의 반대편, 즉 휴먼 오퍼레이터 쪽에 위치한다. 키보드 앞의 직원이 결과에 책임을 지며, 에이전트는 그가 권한을 부여한 시스템에서 그의 대리인으로 동작한다. 점점 더 많은 경우 클라우드에서 실행된다.
Claude Cowork의 위협 모델은 명확하다. 이 에이전트는 기본적으로 로컬 또는 호스팅 인터페이스에서 실행되는 Claude Code이기 때문이다. 로컬 파일 접근, 브라우저 사용, 컴퓨터 사용을 위해서는 데스크톱 앱이 여전히 필요하며, 이러한 기능들은 로컬 머신에 직접 접근하므로 앱이 있어야 동작한다. 따라서 전체 시스템 공격 면은 두 부분으로 구성된다. 오케스트레이션, MCP 호출, 외부 네트워크 요청을 처리하는 (원격) 실행 환경과, 파일 및 화면 접근을 위한 로컬 브릿지다.
앞서 제시한 네 가지 질문에 대한 답은 Claude Cowork의 사용 사례마다 달라진다. 하지만 적절한 통제 체계를 갖추면 리스크를 효과적으로 한정할 수 있다.
아래의 각 통제 방안은 두 가지로 제시된다. 먼저 모든 에이전트 환경이 충족해야 할 요건이고, 다음으로 Claude Cowork에서 이를 어떻게 적용하는지다.
ID는 IdP에서 발급한다: 에이전트의 ID는 기존에 모든 것을 발급하고 회수하던 곳, 즉 IdP에서 관리해야 하며 기존 그룹이 정책의 단위가 되어야 한다. Claude Cowork는 로그인에 SAML 또는 OIDC를, 프로비저닝에 SCIM을 사용한다. Enterprise 플랜에서는 커스텀 역할로 그룹별 권한 범위를 설정할 수 있다.
커넥터 허용 목록이 데이터 경계를 결정한다: 커넥터(MCP) 허용 목록을 통해 에이전트가 접근할 수 있는 시스템을 지정한다. Claude Cowork는 이중 승인 모델을 사용한다. 관리자가 조직 전체에 커넥터를 활성화하고, 각 사용자가 자신의 계정을 개별적으로 인가한다. 역할별 커넥터 제어가 있어 커넥터를 활성화하면 해당 역할의 모든 사용자에게 제공된다(IdP의 그룹을 역할에 할당할 수 있다). 관리자가 어떤 커넥터를 켤지 결정하는 것이 곧 에이전트가 접근할 수 있는 데이터를 결정하는 것이다. 커넥터는 기업 데이터와 프로덕션 데이터의 경계에서 기업 쪽에 두거나, 신뢰할 수 없는 출처의 정보에 접근하는 경우 파괴적이거나 단방향 의사 결정에는 반드시 인간 검토가 필요하도록 설정해야 한다. 예를 들어 개인 에이전트가 이메일 작업 시 웹 검색 결과를 입력으로 활용한다면, 인간 검토 없이 외부에 자동 발송되지 않고 초안으로만 생성되도록 기본값을 설정하는 것이 좋다. 데이터가 경계를 넘어야 한다면 DLP나 DSPM 통제를 거쳐야 한다.
툴 및 작업 단위 승인에서 리스크 감소가 세밀해진다: 에이전트의 툴 목록은 더 세분화된 권한 경계이므로, 커넥터 시스템 전체가 아니라 특정 커넥터의 개별 동사(verb)/작업만 제거할 수 있어야 한다. Claude Enterprise Chat과 Cowork에서는 이제 관리자가 조직 전체 및 역할별로 각 커넥터 내에서 허용되는 작업을 제한할 수 있다. 문서 초안 작성은 허용하되 자동 발송은 금지하거나, 읽기와 검색은 허용하되 삭제는 금지하는 식이다. '프로덕션 데이터베이스가 삭제될까 봐 밤잠을 설친다'면, 삭제 동사를 에이전트 세계에서 완전히 제거하라. 툴 목록에 없는 작업은 시도조차 하지 않는다. (참고: Chrome용 Claude와 Claude Code는 자유도가 더 높아 잘 통제되지 않으면 더 위험할 수 있다. 에이전트가 엔지니어의 브라우저를 이용해 프로덕션 리소스를 삭제하거나, 명령줄 CSP 툴로 같은 일을 할 수도 있다. 자세한 내용은 Claude Code 보안 가이드를 참고하라.)
샌드박스 실행으로 에이전트 작업 환경을 프로덕션 자격 증명과 격리한다: Anthropic이 일관되게 지키는 원칙 중 하나는, 에이전트 루프가 실행되는 환경에 탈취할 만한 가치 있는 자격 증명이 존재해서는 안 된다는 것이다. Claude Cowork의 원격 세션에서 에이전트 루프는 Anthropic 관리 인프라 위의 격리된 임시 샌드박스에서 실행된다. 커넥터 인가 토큰은 샌드박스에 진입하지 않는다. 커넥터 호출이 실제 자격 증명을 주입하는 리버스 프록시를 통해 이루어지기 때문이다. 따라서 샌드박스에는 탈취 가능한 자격 증명이 존재하지 않는다. 2026년 7월 기준, Anthropic에서 풀 리퀘스트로 제출되는 코드의 50% 이상이 내부 Claude Tag 유사 시스템에 의해 작성된다. 이를 안전하게 운영할 수 있는 핵심 이유는, 모든 작업이 프로덕션 키 및 계정과 분리된 임시 VM에서 이루어지고 최종 반영 전에 인간 검토를 거치기 때문이다.
이그레스 허용 목록이 프롬프트 인젝션에 대한 가장 강력한 통제 수단이다: 에이전트 실행 환경을 떠나는 모든 트래픽은 해당 환경이 재구성하거나 우회할 수 없는 프록시를 거쳐야 하며, 지정된 목적지만 접근 가능해야 한다. 에이전트가 읽은 내용에 의해 침해당하더라도 공격자는 결국 데이터를 외부로 빼내야 한다. 외부 요청이 지정된 도메인에만 도달할 수 있다면 공격자가 제어하는 곳으로 보낼 수 있는 경로가 없다. Claude Cowork의 원격 세션에서는 샌드박스를 떠나는 모든 트래픽이 샌드박스가 재구성하거나 우회할 수 없는 필수 프록시를 통과하며, 허용 목록에 있는 목적지만 접근 가능하다. 이 기능은 Claude Managed Agents에도 포함된다.
텔레메트리는 OpenTelemetry를 통해 SIEM으로 전송한다: 에이전트 행동은 이미 조사에 활용하고 있는 시스템에서 사용자 행동과 구별할 수 있어야 하며, 벤더는 이를 직접 방문해야 하는 대시보드가 아닌 원하는 곳으로 전달할 수 있는 스트림으로 제공해야 한다. Claude Cowork에서는 관리자가 조직 설정에서 OTLP 엔드포인트를 구성하면, 에이전트가 모든 툴 호출(툴 이름, MCP 서버, 파라미터, 성공·실패 여부, 소요 시간)을 사용자 ID 및 세션 컨텍스트와 함께 스트리밍한다. 참고: 현재 Claude Cowork 활동은 Anthropic의 Compliance API나 공식 감사 로그에 기록되지 않으나, 이것이 중요한 고객 요구사항임을 인지하고 있다. OpenTelemetry 스트림이 기본 모니터링 경로이며, 프롬프트 콘텐츠는 Claude Cowork의 OTel 출력에 기본으로 포함된다. Claude Code와 달리 옵트인이 아니다. 프롬프트 콘텐츠의 SIEM 보관이나 개인정보 처리에 관한 검토가 필요하다면, 스트림을 활성화하기 전에 미리 진행하라.
조직 전체를 일괄 중단할 수 있는 스위치가 있다: Claude Cowork의 조직 설정에서 토글 하나로 활성 세션을 포함한 모든 사용자의 커넥터를 즉시 비활성화할 수 있다. Enterprise 플랜에서는 완전 차단 전에 더 세밀한 제어가 가능하다. RBAC로 특정 그룹의 접근 권한만 회수하면서 다른 그룹은 유지할 수 있고, 커넥터별 제어로 나머지 배포에 영향을 주지 않고 특정 통합의 쓰기 작업만 비활성화할 수 있다. 제대로 된 인시던트 대응 계획에는 필요하기 전에 이 세 가지 레이어가 모두 정의되어 있어야 한다.
다른 CISO들과 이야기할 때 가장 자주 듣는 말은, 이사회로부터 빠르게 움직이라는 압박을 받는데 거버넌스(즉, 이 질문들에 답하고 통제를 의무화하는 것)가 보안팀을 병목으로 만든다는 것이다. 꼭 그럴 필요는 없다.
실제로 우리 GRC 팀도 자체 에이전트를 운영한다. 보안 설문 답변 작성, 벤더 설문 응답 검토, 하도급업체 변경 통지 검토, 이의를 제기해야 할 항목 플래깅 등이 그 예다.
운영하면서 배운 세 가지를 공유한다.
오늘의 모델 능력을 기준으로 새 프로그램을 설계하면, 프로그램이 출시될 즈음에는 이미 뒤처진 상태가 된다. 6개월 후의 모델을 기준으로 설계하라. 모델 지능이 향상되면 더 많은 자유도가 생기고, 세밀한 프롬프트가 들어간 복잡한 스캐폴드는 불필요해진다. 이런 스캐폴드에 통제 수단을 의존하면, 미래 세대 내부 애플리케이션에서 에이전트 밖으로 제거되어 통제 지점을 잃게 된다.
자체 계정을 가지고 수일에 걸친 작업을 수행하는 에이전트는 Anthropic을 비롯한 여러 조직에서 Claude Tag 같은 툴을 통해 이미 운영되고 있으며, 사람을 관리하듯 거버넌스를 적용해야 한다. ID 관리, 최소 권한, 모니터링, 그리고 몇 분 안에 대응할 수 있는 내부자 리스크 프로그램이 필요하다. 위의 예시처럼 저위험 에이전트로 지금 이 역량을 키우는 조직이, 고자율 사용 사례가 등장했을 때 자신 있게 승인할 수 있다.
위 프레임워크는 조직의 의사 결정을 바꿀 때만 의미가 있다. 시작할 수 있는 세 가지 방법을 제안한다.
리스크 제로를 기다리는 것은 영원히 기다리는 것과 같다. 웹은 여전히 적대적 환경이고, 모델은 빠르게 진화하고 있다. 지금 이 리스크를 측정하고 수용하는 법을 배우는 조직이 경쟁 우위를 가져갈 것이다.
이 글의 배경이 되는 통제 방안, 증명서, 백서는 trust.anthropic.com에서 확인할 수 있다. AI 가속 공격 방어에 대한 동반 아티클도 함께 참고하길 바란다.
이 글은 Anthropic 부(副) CISO Jason Clinton이 작성했습니다.