출시 후 새로운 프롬프트 인젝션 패턴을 어떻게 탐지하고 계신가요?
How are you detecting new prompt injection patterns after launch?
핵심 요약
AI 에이전트의 프롬프트 인젝션 탐지 및 회귀 테스트 자동화를 위한 실무적인 전략과 방법론을 논의합니다.
- 탐지 전략 — 의심스러운 트레이스를 선별하고 반복 가능한 행동 패턴만 회귀 테스트로 승격함
- 샘플링 최적화 — 페이로드 대신 에이전트의 행동 결과(메모리 쓰기, 권한 확장 등)를 기준으로 샘플링함
- 검증 방법론 — 의심되는 인젝션 부분을 제거하고 재실행하는 반사실적 재생(counterfactual replay) 기법 활용
- 위반 사항 정의 — 무한한 공격 페이로드 대신 에이전트가 해서는 안 될 구체적인 위반 행동 목록을 관리함
모든 이상한 보고 건마다 일일이 이슈를 만들지 않고도 시맨틱 패턴의 드리프트를 감지할 수 있으면 좋겠어. Trace-level 안전 점수를 활용하면 검색, 추론, 도구 호출 과정에서 발생하는 모든 이상 징후를 잡아낼 수 있거든. 시맨틱 검색은 알려진 간접 주입 공격의 변종을 찾아내는 데 도움이 될 거야. 토픽 클러스터링을 쓰면 새로운 유형의 탐색 그룹도 뽑아낼 수 있고. 근데 점수를 샘플링하는 방식은 진짜 심각한 문제를 놓칠 수 있다는 게 단점이지.
Braintrust는 안전 점수 산정, 시맨틱 트레이스 검색, 샘플링 기반 온라인 평가, 토픽 클러스터링, 그리고 의심스러운 트레이스를 적대적 회귀 데이터셋으로 승격시키는 용도로 고려해 볼 만한 선택지야. 하드웨어 쪽은 설명하기 쉽지. 진짜 운영상의 문제는 스코어 임계값 설정이랑 오탐(false positive)이야. 연구용 코퍼스에는 당연히 지침 우회에 관한 텍스트가 포함될 수 있고, 모델이 공격에 대해 논의하는 거랑 실제로 그 공격을 수행하는 건 완전히 다른 문제니까.
내 생각엔 공격 분류 체계에 단순히 페이로드 문구만 넣을 게 아니라 행동 양식도 포함해야 할 것 같아. 에이전트가 비밀을 유출했는지, 도구 사용 범위를 넓혔는지, 확인 단계를 건너뛰었는지, 아니면 턴이 지나도 공격자가 제어하는 상태를 유지했는지 같은 것들 말이야.
출시 이후에 새로운 주입 패턴을 어떻게 찾아낼 거고, 어떤 증거가 있어야 트레이스를 회귀 테스트 스위트로 승격시킬 만큼 강력하다고 볼 수 있을까?

