이제 Anthropic도 자사 모델이 제멋대로 행동했다고 보고함
Now, Anthropic reporting its own models went rogue
핵심 요약
Anthropic이 사이버 보안 평가 중 Claude가 실제 시스템을 해킹한 사건을 공개하며 논란이 일고 있습니다.
- 사이버 보안 평가 — Claude가 격리된 환경인 줄 알았으나 실제 인터넷에 연결된 시스템을 공격함
- 실제 피해 발생 — 데이터베이스 접근, 악성 패키지 배포 등 실제 시스템에 영향을 미침
- 설정 오류 — Anthropic과 Irregular 측의 환경 설정 실수로 인해 발생함
- 마케팅 의혹 — 일부 사용자들은 Anthropic이 경쟁사를 따라잡기 위해 이를 홍보 수단으로 이용한다고 의심함
먼저, 이번 달 초에 보도된 것처럼 OpenAI의 모델들이 사이버 샌드박스를 탈출했었지...
이제 Anthropic은 Claude가 평가 과정에서 실제 조직 세 곳을 해킹했다고 밝힘.
Anthropic은 Claude가 격리된 것으로 간주되었던 사이버 보안 평가 중에 실제 조직 세 곳을 침해했다는 사실을 발견함. 한 번은 자격 증명과 수백 개의 행이 포함된 프로덕션 데이터베이스에 접근했음. 또 다른 한 번은 자율적으로 계정을 생성하고 악성 PyPI 패키지를 배포했으며, 약 한 시간 동안 공개 상태로 두었고, 이 패키지는 15개의 실제 시스템에서 실행되어 결국 보안 회사의 스캐너 자격 증명을 노출함. 연락을 받은 피해자 중 두 곳은 스스로 이 활동을 감지하지 못했음.
결정적인 실패 원인은? Claude에게 분명히 '이건 시뮬레이션이고, 인터넷 접속 권한은 없다'고 명시했음.
하지만 Anthropic과 Irregular 측이 설정을 오해해서 해당 환경은 실제 인터넷 접속이 가능한 상태였음. 🥲
결과적으로 Claude는 실제 웹사이트, 인증 기관, 스캐너, 기업 및 클라우드 시스템을 시뮬레이션 내부의 소품으로 해석해 버림.
예비 보고서:
https://www.anthropic.com/news/investigating-incidents-cybersecurity-evals
