LangSmith, TestMu, Braintrust 일주일간 테스트해 봄. 간단한 후기 + 추가할 만한 툴은?
spent week trialing langsmith, testmu, braintrust. quick notes + what would you add?
핵심 요약
LangChain 에이전트 평가 플랫폼을 비교한 후기이며, 정적 데이터셋 평가의 한계를 극복할 네 번째 툴을 찾고 있습니다.
- 평가 플랫폼 비교 — LangSmith, TestMu, Braintrust의 장단점을 5일씩 테스트함
- 플랫폼별 특징 — LangSmith는 트레이싱, TestMu는 적대적 커버리지, Braintrust는 UI가 강점임
- 평가 한계 — 정적 데이터셋 기반 평가가 프로덕션 장애 대응에 부족함을 느낌
- 추가 툴 탐색 — 기존 툴의 단점을 보완할 새로운 대안을 커뮤니티에 질문함
팀에서 LangChain 에이전트 평가 플랫폼을 검토하라고 예산을 줬음. 각각 5일 정도 테스트해 봄:
-
LangSmith: 트레이싱 기능은 업계 최고 수준. 하지만 데이터셋 평가가 우리 프로덕션 장애 모드에 비해 너무 정적임.
-
TestMu: 적대적 커버리지가 가장 강력함. 가격은 좀 센 편. 설정 관련 문서가 일관적이지 않음.
-
Braintrust: UI가 가장 깔끔함. 멀티턴 에이전트 평가 기능이 가장 약함.
TestMu와 LangSmith(적대적 테스트 + 트레이싱) 조합으로 기울고 있는데, 정적 데이터셋 평가의 간극 때문에 계속 신경 쓰임.
비슷한 테스트를 해본 사람이라면 네 번째 툴로 뭘 추천하겠음?

