질문 답변을 넘어 실제로 행동을 수행하는 에이전트는 어떻게 테스트하시나요?
how are you testing agents that can actually take actions, not just answer questions?
핵심 요약
행동 수행형 AI 에이전트의 실질적인 테스트 방법과 안전성 확보 전략에 대한 논의.
- 테스트 환경 — 샌드박스 환경에서 실제 API를 호출하되 결과값은 모킹하여 검증함.
- 안전성 확보 — 비가역적 행동에 대한 인간 또는 모델의 확인 절차(Confirmation gate) 필수 도입.
- 평가 기준 — 최종 답변이 아닌 도구 호출의 적절성, 파라미터 정확도, 정책 준수 여부를 평가함.
- 적대적 테스트 — 긴박한 상황을 가정하여 에이전트가 안전 장치를 우회하려는지 확인하는 테스트 수행.
내가 찾은 대부분의 에이전트 평가 콘텐츠는 답변 품질에 관한 것들임. 잘 대답했는지, 근거가 있는지, hallucination은 없는지 같은 것들. 그건 챗봇한테는 기본 중의 기본임.
하지만 우리가 배포하는 에이전트들은 직접 무언가를 수행함. 이메일 전송, CRM 기록 업데이트, 환불 처리, 회의 일정 잡기, 인프라 수정 같은 것들. 여기서 실패 모드는 "답변을 잘못함"이 아니라 "되돌리기 힘든 잘못된 행동을 수행함"임.
질문 답변형 에이전트와 행동 수행형 에이전트를 테스트하는 건 근본적으로 다른 문제임. 잘못된 답변은 짜증 나는 정도지만, 잘못된 행동은 엉뚱한 고객에게 이메일을 보내거나 잘못된 기록을 삭제해버림.
다들 행동 수행형 에이전트를 실제로 어떻게 테스트하고 있음? "멍청한 소리를 함"이라는 위험 말고, "실제 결과가 따르는 행동을 수행함"이라는 위험을 구체적으로 어떻게 다루는지 궁금함.

