JEV(또는 유사 도구)가 하네스(harness) 환경에서 실제로 유용한가요?
Is JEV (or similar) actually useful in a harness?
핵심 요약
에이전트 워크플로우에서 JEV와 같은 분류기를 사용하는 것이 모델의 추론 능력을 저해하지 않는지, 그리고 그 실효성에 대해 논의합니다.
- 효율성 및 비용 — LLM 대신 가벼운 분류기를 사용하여 토큰 비용을 절감하고 속도를 높임
- 의사결정 분리 — 모델의 추론 과정이 생략될 위험이 있으나, 게이트웨이로 활용해 안전성을 확보함
- 분류기 활용 사례 — 도구 호출, 서브 에이전트 라우팅, 문서 관련성 판단 등에 유용함
- 성능 검증 필요 — 단순 분류 정확도보다는 전체 작업 성공률과 제약 조건 유지 여부를 확인해야 함
Jev(나 그 비슷한 거)가 특정 상황에서 존나 유용한 건 알겠거든? 근데 다들 이걸 왜 하네스(harness) 안에서 툴 콜, 가드레일, 평가 같은 데 쓰려고 난리인지 도통 이해가 안 가네.
의사결정을 Jev한테 떠넘겨버리면, LLM은 왜 이런 행동을 했는지에 대한 맥락을 전혀 모르게 되잖아. 사실상 모델한테서 판단이랑 추론 과정을 떼어내 버리는 꼴이지. 그냥 모델한테 "야, 가서 X 해"라고 명령만 내리는 거랑 뭐가 달라? 이러면 워크플로우에서 왜 이런 일이 벌어졌는지에 대한 사고의 흐름(chain of thought)도 다 날아가는 거 아님?
단순한 에이전트 작업에서는 별문제 없을 거라 보는데, **딥(deep)**한 에이전트 작업이나 범용(general) 목적의 작업에서는 이게 더 큰 문제가 되지 않을까?
혹시 이와 관련해서 데이터나 평가/벤치마크 자료, 아니면 블로그 글 같은 거 본 사람 있음?
내가 지금 완전히 잘못 생각하고 있는 건가? 다들 어떻게 생각하는지 궁금함.
