에이전트 평가(Agent Evals) 방법론
Agent Evals
핵심 요약
비즈니스 프로세스 준수를 위한 에이전트 평가 방법과 프레임워크에 대한 조언을 구하는 글.
- 평가 방법론 — LLM-as-a-judge를 활용해 답변의 포함 여부와 메트릭을 측정함
- 테스트 자동화 — CI/CD 파이프라인에 단위 테스트를 통합하여 검증함
- 상태 유지 에이전트 — 상태가 복잡해질수록 단순 평가 방식의 한계가 드러남
- 평가 프레임워크 — Monocle2ai와 같은 외부 도구 활용을 추천함
현재 비즈니스 프로세스 준수를 안내하는 에이전트를 구축 중입니다.
이론적으로 에이전트의 입력 공간은 사용자가 어떤 프롬프트든 입력할 수 있기 때문에 무한합니다. 저는 이 무한한 공간을 커버하기 위해 평가를 구성할 여러 하위 카테고리를 만들었습니다.
질문-답변 쌍을 만들기 시작했습니다. 답변에는 'must_contain(반드시 포함)' 및 'must_not_contain(반드시 포함하지 않음)' 필드가 있습니다. 그런 다음 간단한 LLM-as-a-judge를 적용하여 답변의 점수를 매기고 recall(재현율) 및 f1과 같은 메트릭을 계산합니다.
또한 에이전트가 어디에서 막히는지 파악하기 위해 총 도구 호출 수 등 운영 메트릭도 수집합니다.
제가 궁금한 점은 여러분이 구축하는 에이전트를 어떻게 평가하느냐는 것입니다. 여러분도 그냥 LLM-as-a-judge를 사용하시나요? 테스트에 도움이 될 만한 좋은 프레임워크를 찾으셨나요?


