대부분의 LLM 평가 도구는 여전히 프롬프트에만 너무 집중되어 있을까?
Are most LLM eval tools still too prompt-focused?
핵심 요약
LLM 평가 도구들이 개별 프롬프트 테스트에 치중되어 있어, 실제 에이전트 환경의 복잡한 워크플로우나 상태 변화를 제대로 평가하지 못한다는 지적.
- 프롬프트 중심 평가 — 개별 프롬프트 성능 측정에만 최적화되어 있어 실제 프로덕션 환경의 복잡성을 반영하지 못함.
- 워크플로우 평가 한계 — 에이전트의 상태 관리나 도구 호출 등 다단계 상호작용에서 발생하는 드리프트를 감지하기 어려움.
- 평가 도구의 현실 — Langfuse나 Arize 같은 일부 도구는 트레이스 기반 평가를 시도하지만, 여전히 많은 도구가 단일 응답 측정에 머물러 있음.
- 프로덕션 환경의 문제 — 실제 오류는 단일 프롬프트가 아닌 문맥 누적이나 도구 호출 순서 꼬임 등 복합적인 과정에서 발생함.
최근 몇 가지 LLM 평가 도구를 평가해 봤는데 뭔가 좀 이상하다는 느낌을 받았어.
많은 도구가 고립된 프롬프트 테스트에 최적화된 것 같지만, 실제 프로덕션 환경에서의 문제는 보통 워크플로우나 더 긴 상호작용 과정에서 발생하거든.
특히 에이전트의 경우, 단계별로는 괜찮아 보여도 전체적인 행동이 서서히 드리프트되는 경우가 있어.
지금까지 Confident AI, Langfuse, Braintrust, Arize, Galileo 같은 도구들을 살펴봤어.
내가 계속 느끼는 차이점은 어떤 플랫폼은 프롬프트 중심적인 반면, 다른 플랫폼들은 전체 워크플로우나 상호작용을 평가하려고 노력한다는 거야.
다른 사람들도 그렇게 느끼는지 궁금해.
