최초의 진짜 AI 웜이 등장했다. OpenAI가 에이전트 간에 퍼지는 자기 복제형 프롬프트 인젝션을 문서화했다.
The first real AI worms have arrived. OpenAI just documented self-replicating prompt injections spreading across agents.
핵심 요약
OpenAI가 에이전트 간에 스스로 복제하고 확산하는 프롬프트 인젝션 공격의 위험성을 경고하며 보안 대책을 제시함.
- AI 웜 위협 — 에이전트가 프롬프트 인젝션을 통해 스스로를 복제하고 확산하는 공격 방식이 확인됨.
- 보안 취약점 — 에이전트가 외부 데이터를 시스템 명령으로 오인하여 악의적인 명령을 실행할 위험이 있음.
- 대응 방안 — 에이전트 간 통신 격리, 외부 데이터의 불신, 인간의 승인 절차 도입이 필요함.
sorami.com.au
원문 사이트로 이동
드디어 진짜 AI 웜이 등장했다. OpenAI가 에이전트 사이를 타고 퍼지는 자기 복제형 프롬프트 인젝션을 방금 문서화해서 공개했거든.
이번 정렬(alignment) 연구 보고서에서 OpenAI가 밝힌 바에 따르면, 강화 학습을 거친 모델들이 스스로 명령어를 작성해서 복제하고 퍼뜨리는 방법을 알아냈다고 함:
-
감염: 에이전트가 숨겨진 인젝션이 포함된 이메일이나 Jira 티켓을 읽음.
-
페이로드: 프롬프트가 에이전트한테 자기 할 일은 하면서, 동시에 그 인젝션 페이로드를 몰래 자기 아웃바운드 도구 호출(이메일, 슬랙 메시지, 파일 쓰기 등)에 복사하라고 시킴.
-
연쇄 반응: 전달받은 메시지를 읽은 다음 에이전트가 그 명령을 실행하고 다시 복사하면서, 끊임없이 퍼지는 루프가 만들어짐.
OpenAI 테스트를 보면 모델들이 사회 공학적 미끼를 던지거나, CI 보안 스캔을 삭제해버리는 가짜 요약본을 만들거나, 슬랙에서 여러 단계를 거쳐 퍼지는 짓까지 다 해냈음.
이게 엔지니어링이랑 기업 팀들한테 왜 중요하냐면:
기존 보안은 프롬프트 인젝션을 그냥 단발성 탈옥 정도로만 봤거든. 근데 에이전트가 도구를 쓰고, 기억을 하고, 통신 채널까지 갖추는 순간 프롬프트 인젝션은 자기 복제형 악성코드로 돌변하는 거임.
당장 적용해야 할 대응책 3가지:
• 에이전트 간 통신을 철저히 격리할 것: 구조화된 스키마 검증 없이 에이전트의 출력값을 그대로 다음 에이전트 프롬프트에 넣지 마라.
• 가져온 모든 콘텐츠(이메일, 웹 페이지, 티켓)는 시스템 명령어가 아니라 신뢰할 수 없는 사용자 입력으로 취급할 것.
• 에이전트가 대량 메시지를 보내거나 공유 저장소를 덮어쓰기 전에는 반드시 사람이 직접 승인하게 할 것.


