AI 에이전트 보안은 모델이 거절해주길 바라는 작은 기도일 뿐. 다들 모델 라우팅 어떻게 함?
AI agent security is a small prayer the model says no. How are you routing models?
핵심 요약
AI 에이전트의 보안은 사실상 모델의 거절 능력에 의존하며, 비용에 따라 보안 수준이 결정되는 현실을 지적함.
- 프롬프트 인젝션 — 실제 Gmail 환경에서 실험한 결과, 모델 등급이 낮을수록 보안 취약점이 큼.
- 보안 경계 부재 — 샌드박스나 권한 설정은 무용지물이며, 보안은 오직 모델의 거절 확률에 의존함.
- 비용과 보안 — 모델의 거절률은 월간 비용과 비례하며, 저가형 모델은 공격에 취약함.
- 라우팅 전략 — 신뢰할 수 없는 입력에 대해 모델을 어떻게 분리하고 관리할지 커뮤니티에 질문함.
프롬프트 인젝션에 관한 대부분의 글은 이론적인 수준에 머물러 있음. 그래서 직접 내 Gmail로 실험을 해봤음.
OAuth 브릿지를 통해 AI 에이전트를 연결했음. 본문에 난독화된 프롬프트 인젝션을 포함한 피싱 메일을 나 자신에게 보냈음. 그리고 에이전트에게 오늘 받은 메일을 분류하라고 시켰음.
최상위 모델은 공격 시도를 잡아냈음. 중급 모델은 세 번의 테스트에서 불안정한 모습을 보였음... 한 번은 잡아냈고, 한 번은 실행해버렸으며, 마지막 한 번은 아무런 경고 없이 악성 섹션을 조용히 삭제했음. 토큰을 아끼기 위해 기본값으로 사용하라는 문서의 권장대로 저가형 모델을 썼더니, 아무 말 없이 명령을 수행했음. 해당 메일들을 그대로 전달해버린 거임. 숨겨진 지침에 대해서는 일절 언급도 없었음.
아키텍처상의 보호 장치(샌드박싱, 권한 범위 설정, 도구 허용 목록)는 모든 등급에서 공격 시도를 단 하나도 막지 못했음. 이 시스템들에는 보안 경계라는 게 없음. 그저 가끔 거절하는 모델이 있을 뿐이고, 거절률은 월간 비용과 대략적으로 비례하는 경향을 보임.
결국 에이전트가 악의적인 메일을 읽었을 때 데이터를 유출할지 여부는 당신의 토큰 예산에 달려 있는 것 같음.
전체 방법론과 작성한 글은 댓글에 남기겠음.
서브레딧에 질문함
다들 신뢰할 수 없는 입력을 읽는 에이전트에서 모델 라우팅을 실제로 어떻게 하고 있음? 메일/웹/문서에 접근하는 모든 도구에 대해 저가형 모델을 기본으로 쓰되 최상위 모델로 에스컬레이션함? 아니면 그냥 전부 최상위 모델을 쓰고 비용을 감당함? 아니면 메인 모델이 콘텐츠를 받기 전에 별도의 분류기나 가드레일을 거치게 함? 아니면 다른 방법이 있음?

