AI 에이전트 측정 방식, 우리가 잘못 짚고 있는 것 같다
I think we're measuring the wrong thing for AI agents
핵심 요약
AI 에이전트 평가 시 인프라 지표보다 목표 달성률, 인간 개입률 등 행동 지표가 중요하다는 제안.
- 인프라 지표의 한계 — 지연 시간이나 에러율만으로는 에이전트의 잘못된 의사결정을 잡지 못함
- 행동 기반 실패 — API는 정상(200)이어도 루프 발생이나 할루시네이션 같은 행동 결함이 발생함
- 새로운 지표 제안 — 목표 달성률, 인간 개입률, 복구율 등 실질적인 운영 지표 도입 필요성
- 운영 노하우 공유 — 실제 운영 환경에서 에이전트 실패를 감지하는 유효한 지표에 대한 질문
우리는 여전히 AI 에이전트를 웹 서비스처럼 측정하고 있습니다.
- 지연 시간
- 에러율
- 가용성
- 비용
이런 지표들도 중요하지만, 저는 가동률은 완벽한데 형편없는 결정을 내리는 에이전트들을 봐왔습니다.
HTTP 요청은 성공합니다.
툴 호출도 성공합니다.
모든 API는 200을 반환합니다.
그런데도 에이전트는 엉뚱한 항공편을 예약하고, 20번씩 루프를 돌고, 정책을 자신 있게 할루시네이션하거나, 명백히 끝나지 않은 작업을 완료로 표시합니다.
이것들은 인프라 실패가 아니라 행동 실패입니다.
운영 환경에서는 다른 지표 세트가 필요해 보입니다:
- 허위 완료율
- 목표 달성률
- 루프 빈도
- 잘못된 툴 선택
- 인간 개입률
- 복구율
다들 운영 환경에서 무엇을 측정하고 계신지 궁금합니다. 실제 에이전트 실패를 잡는 데 정말 도움이 되었던 지표는 무엇인가요?

