Anthropic은 NVIDIA와 협력해 자사의 오픈 에이전트 안전 플랫폼(Open Agent Safety Platform) 에이전트 스택에 보안과 제어 기능을 다층으로 보강했습니다.
NVIDIA는 오늘 AI 보안 강화를 위한 오픈 소프트웨어 플랫폼이자 레퍼런스 시스템 설계인 오픈 에이전트 안전 플랫폼(Open Agent Safety Platform)을 발표했습니다. Anthropic은 NVIDIA와 협력해 에이전트 스택에 보안과 제어 기능을 다층으로 보강했습니다.
Claude Managed Agents는 프로덕션 수준의 에이전트를 대규모로 구축·배포할 수 있는 조합형 API 제품군으로, 에이전트가 필요로 하는 인증 정보를 보안 저장소(vault)에 보관해 에이전트가 직접 접근하지 못하도록 차단합니다. 오픈 소스 소프트웨어인 NVIDIA OpenShell은 에이전트가 실행하고 접근할 수 있는 범위를 제어하도록 설계되었습니다. OpenShell과 함께 Managed Agents를 사용하는 고객은 에이전트의 행동 범위를 제한하고, 수행 내역을 검토하며, 제한이 올바르게 적용되고 있는지 확인할 수 있습니다.
기업들은 AI를 질문 답변 용도로만 활용하던 단계에서 벗어나, 여러 사업 부문에 걸쳐 복잡한 업무를 처리하고 사내 데이터를 활용하며 사용자를 대신해 직접 행동을 수행하는 에이전트를 배포하는 단계로 나아가고 있습니다. 모델 성능이 향상될수록 에이전트의 활용 범위는 넓어지고 접근 권한도 커집니다. 에이전트의 접근 권한이 클수록, 기업이 그 행동을 통제하고 감시해야 할 필요성도 그만큼 높아집니다.
보호는 모델 내부의 안전장치에서 시작됩니다. Managed Agents와 NVIDIA OpenShell은 모델 외부에서 적용되는 추가 제한 계층으로, 에이전트의 행동 범위를 통제합니다. 각 계층은 독립적으로 제한을 적용하도록 설계되어 있어, 보호 기능이 특정 계층 하나에 의존하지 않습니다. 또한 각 계층은 모듈 방식으로 구성되어 있어, 기업은 자사 환경에 맞는 계층만 선택해 도입할 수 있습니다.
Managed Agents에서는 에이전트 루프가 작업이 실행되는 격리 환경인 샌드박스와 분리된 별도의 서버에서 동작합니다. 비밀번호와 액세스 키 등 인증 정보는 별도의 보안 저장소에 보관되므로, 에이전트가 이를 직접 확인할 수 없습니다.
Managed Agents는 각 에이전트의 수행 내역을 기록하는 감사 추적(audit trail) 기능과 기업의 기존 접근 제어 시스템과의 연동도 지원합니다. 기업은 자체 샌드박스 환경을 그대로 사용할 수 있으며, 실행 위치와 방식도 자유롭게 선택할 수 있습니다.
OpenShell은 NVIDIA가 개발한 오픈 소스 보안 런타임 소프트웨어입니다. AI 에이전트의 모든 행동을 관리·모니터링하고, 모든 작업에 정책을 적용합니다. OpenShell은 명시적으로 허용된 규칙이 없는 한 모든 행동을 차단합니다. 에이전트가 사용하려는 각 도구를 검사하고, 에이전트가 접근하는 파일, 네트워크 연결, 데이터에 규칙을 적용합니다. 이 규칙들은 에이전트 외부에서 적용되며, OpenShell은 허용하거나 차단한 모든 결정을 로그로 기록합니다.
팀은 최소한의 권한으로 시작해 로그를 검토하고, Claude를 활용해 작업에 필요한 최소 접근 수준으로 규칙을 점진적으로 좁혀 나갈 수 있습니다. OpenShell의 정책 증명기(policy prover)는 팀이 작성한 규칙 하에서 에이전트가 실제로 접근할 수 있는 범위를 수학적 증명으로 확인해 줍니다.
Managed Agents는 현재 이용 가능합니다. 자체 인프라 또는 관리형 공급업체를 통해 직접 제어하는 샌드박스 환경에서 운영할 수 있습니다. NVIDIA OpenShell은 Apache 2.0 라이선스 기반의 오픈 소스로, GitHub와 NVIDIA 개발자 리소스 페이지에서 내려받을 수 있습니다.