AI 에이전트 배포 후 운영 환경에서의 평가 방법은 무엇인가요?
How are people evaluating AI agents after they go into production?
핵심 요약
AI 에이전트 배포 후 실제 운영 환경에서 발생하는 복잡한 대화와 오류를 평가하고 관리하는 실무적인 방법론에 대한 논의.
- 운영 환경 평가 — 실제 사용자 대화를 기반으로 한 지속적인 평가 데이터셋 구축
- 오류 탐지 — 신뢰도 점수, 사용자 피드백, 하위 신호(재질문 등)를 활용한 자동 플래그 설정
- 회귀 테스트 — 실제 발생한 실패 사례를 새로운 평가 케이스로 전환하여 시스템 개선
- 버전 관리 — 정책 문서와 검색 소스를 버전별로 기록하여 오류 추적 및 재평가 수행
요즘 에이전트 빌딩, 프롬프트 개선, 툴 추가, RAG, 메모리 같은 얘기들 진짜 많이 보이네.
근데 난 에이전트가 실제로 실사용자랑 대화하기 시작한 다음에 무슨 일이 벌어지는지가 궁금함.
예를 들어 에이전트가 대화 5,000건을 처리했다고 치자.
이때 다음 항목들을 어떻게 확인하고 있음?
- 제대로 된 답변을 했는지?
- 회사의 최신 정책을 잘 따랐는지?
- 상담원 연결을 했어야 했는데 안 한 건 아닌지?
- 구식 정보를 갖다 쓴 건 아닌지?
- 기술적으로는 그럴싸한데 틀린 소리를 한 건 아닌지?
- 똑같은 실수를 계속 반복하고 있지는 않은지?
자동화된 평가(evals)가 도움 되는 건 당연한데, 평가 셋 만들 때 예상치 못했던 골 때리는 실전 대화들은 다들 어떻게 처리하는지 궁금함.
출시 전 테스트 말고, 진짜 프로덕션 환경에서의 QA가 궁금한 거임.
혹시 지금 프로덕션에서 에이전트 돌리고 있는 형들, 실제 QA나 평가 프로세스 어떻게 돌아가고 있음?

