대부분의 AI 에이전트 평가 방식은 실행 효율성을 완전히 무시하고 있다
Most AI agent evals completely ignore execution efficiency
핵심 요약
AI 에이전트 평가 시 결과물만 볼 게 아니라, 비효율적인 실행 과정과 오케스트레이션 계층을 면밀히 분석해야 한다는 지적.
- 평가 방식의 맹점 — 결과물만 확인하는 기존 방식은 에이전트의 비효율적인 실행 과정을 놓치게 함.
- 실행 추적의 중요성 — 중복된 도구 호출이나 불필요한 루프 등 오케스트레이션 계층의 문제를 파악하는 데 필수적임.
- 운영 효율성 저하 — 데모에서는 완벽해 보여도 실제 환경에서는 비용과 지연 시간 문제로 인해 신뢰성이 떨어짐.
- 평가 지표의 확장 — 중복 작업, 계획 준수 여부, 도구 사용의 적절성 등을 측정하는 새로운 평가 기준이 필요함.
내부적으로 AI 에이전트를 평가하다가 이상한 점을 발견했음:
많은 에이전트가 "작업 완료" 항목에서는 완벽한 점수를 받으면서도, 내부적으로는 엄청나게 비효율적이었음.
예시:
- 동일한 도구를 동일한 인자로 여러 번 호출
- 불필요한 검색 단계
- 반복되는 추론 루프
- 필요 이상으로 긴 실행 경로
기술적으로는 성공임.
운영 측면에서는 끔찍함.
대부분의 평가 설정은 다음만 확인함:
input → output
하지만 프로덕션 장애는 보통 중간에서 발생함:
바로 오케스트레이션 계층임.
실행 추적(execution trace)은 최종 답변만 보는 것보다 에이전트의 품질에 대해 훨씬 더 많은 정보를 알려줌.
우리는 다음과 같은 항목들을 측정하기 시작했음:
- 중복 작업
- 실행 효율성
- 계획 준수 여부
- 도구 사용의 적절성
흥미로운 패턴:
데모에서는 인상적으로 보이는 에이전트들이 실제 규모에서는 엄청나게 비싸지고 신뢰할 수 없게 되는데, 이는 아무도 그 에이전트가 어떻게 답변에 도달했는지 측정하지 않았기 때문임.
다른 분들도 에이전트 평가에서 같은 문제를 겪어보셨는지 궁금함?

