testmu의 툴 호출 평가기가 병렬 langgraph 호출을 잘못된 것으로 표시함
testmu's tool-call evaluator marks our parallel langgraph calls as wrong when they're actually correct
핵심 요약
Langgraph의 병렬 툴 호출을 testmu 평가기가 순서 오류로 잘못 인식하는 문제 해결 방법 문의.
- Langgraph 병렬 호출 — Send 메커니즘을 통한 병렬 툴 호출이 평가기에서 오류로 처리됨.
- 평가기 로직 문제 — testmu가 툴 호출을 순차적 의존성으로만 판단하여 병렬성을 잘못 해석함.
- 시도한 해결책 — 메타데이터 설정 및 커스텀 루브릭 적용을 시도했으나 완전한 해결이 어려움.
- 커뮤니티 질문 — Langgraph 환경에서 병렬 호출 시 testmu 평가기를 우회하거나 커스텀 검증을 사용하는지 문의.
testmu의 툴 호출 검증 기능이 langgraph 병렬 브랜치에서 문제를 일으키고 있음.
환경: langgraph 0.2.x, claude sonnet 4.5, 6개의 툴을 사용하는 에이전트. 플래너가 여러 소스의 정보가 필요하다고 판단하면 langgraph의 Send 메커니즘을 통해 병렬로 툴을 호출함. 이는 올바른 동작이며 더 빠르고 토큰 비용도 적게 듦.
testmu의 툴 호출 궤적 평가기는 이를 잘못된 것으로 점수를 매김. 기본 루브릭은 "의존성 순서대로 호출된 툴"을 기대하지만, 병렬 호출에는 선형적인 순서가 없음. 평가기가 병렬성을 잘못된 시퀀싱으로 해석하여 플래그를 지정함.
시도한 것:
-
expected_trajectory 메타데이터에 모든 병렬 툴을 나열함 (여전히 플래그 지정됨)
-
궤적 스코어러에 커스텀 루브릭 오버라이드 (작동은 하지만 나머지 툴 호출 검증 기능을 잃게 됨)
-
parallel_tool_calls 설정에 대한 문서 검색 (존재하지 않음)
혹시 langgraph에서 이 문제를 해결한 사람 있음? 아니면 병렬 케이스에 대해서는 testmu 궤적 평가를 우회하고 커스텀 검증을 실행함?


