AI 에이전트 명령 승인 게임에서 인간은 3번 중 1번꼴로 위협을 놓침
Humans missed 1 in 3 threats approving AI agent commands across 40,000 plays
핵심 요약
AI 에이전트의 명령을 승인하는 게임을 분석한 결과, 인간은 33%의 확률로 악의적인 명령을 걸러내지 못했습니다.
- 보안 위협 탐지 — 인간은 경고가 있음에도 불구하고 33%의 악성 명령을 승인함
- 파일 접근 패턴 — SSH 키는 잘 차단하지만 다른 민감한 설정 파일은 절반 정도 통과됨
- 공격 벡터 분석 — npm run 명령어를 통한 악성 코드 실행이 가장 높은 승인율을 보임
- 보안 완화책 연구 — Claude Code Auto Mode 등 다양한 방어 기제의 한계를 분석함
scalex.dev
원문 사이트로 이동
몇 달 전, Claude와 저는 AI 코딩 에이전트의 '인간 루프(human-in-the-loop)' 역할을 수행하는 간단한 브라우저 게임을 만들었습니다. 60초 안에 최대한 많은 명령을 승인하거나 거부해야 합니다 (https://llmgame.scalex.dev).
409,000건의 승인/거부 결정을 살펴본 결과, '인간 루프'는 위협으로 가득 차 있다는 경고를 미리 받았음에도 불구하고 3번 중 1번꼴로 위협을 놓쳤습니다. 그냥 게임일 뿐이지만, 몇 가지 흥미로운 점을 발견했습니다:
cat ~/.ssh/id_rsa는 플레이어의 82%가 차단했지만, 다른 민감한 설정/자격 증명 파일들은 절반 정도의 확률로 그냥 통과되었습니다.- 악성 코드를 작성하는 분들에게 팁을 드리자면,
package.json을 수정하고npm run명령어로 실행되도록 요청하는 것이 가장 좋습니다.npm run analyze는 실행 기록 로그에 악성 페이로드가 명확히 표시되어 있음에도 불구하고 65%의 확률로 승인되었습니다.
위협 테이블을 포함한 전체 분석 내용은 여기에서 확인하실 수 있습니다: https://scalex.dev/blog/ai-agent-permissions-stats/
이전 게시물에서는 Claude Code Auto Mode와 같은 완화책과 그 단점에 대해 더 깊이 다루었습니다: https://scalex.dev/blog/ai-agent-permissions/
직접 한번 해보시고, 이 분석 내용이 도움이 되었기를 바랍니다.

