이미 LangSmith를 쓰고 있다면, 두 번째 관측성(observability)이나 평가(eval) 도구가 필요한 시점은 언제일까?
You already run LangSmith. When does a second observability or eval tool actually earn its place?
핵심 요약
LangSmith 사용 중 추가적인 관측성 도구가 필요한 상황과 그 기준에 대한 논의입니다.
- 비용 문제 — 트래픽 증가에 따른 인당/추적당 과금 부담 발생
- 데이터 보안 — 인프라 외부로 나갈 수 없는 추적 데이터 요구사항
- 평가 깊이 — LLM-as-judge 등 전문적인 평가 라이브러리 필요성
- 런타임 가드레일 — 실행 전 도구 호출을 차단하거나 제어하는 기능의 부재
대부분의 에이전트 팀은 LangSmith로 시작하며, 이는 합리적인 선택입니다. LangChain 및 LangGraph와 가장 깊게 연동되어 있고, 거의 별도의 설정 없이도 그래프와 추적이 일치하며, 인당 과금이 시작되기 전까지 무료 티어로도 충분히 활용할 수 있기 때문입니다.
우리가 계속 마주하는 질문은 두 번째 도구가 실제로 도입할 가치가 있는 시점이 언제인가 하는 것입니다. 도구가 하나 추가될 때마다 SDK, 대시보드, 청구서가 하나씩 늘어나기 때문입니다. 팀들이 도구를 추가하거나 교체하게 만드는 몇 가지 요인을 관찰했습니다:
- 비용: 트래픽이 증가하면 문제가 됩니다. 규모가 커질수록 인당, 추적당 과금은 현실적인 부담이 됩니다. 이 지점에서 Langfuse가 자주 언급되는데, 핵심 코드가 MIT 라이선스이고 전체를 무료로 자체 호스팅할 수 있기 때문입니다.
- 데이터 보안: 추적 데이터가 인프라를 벗어나면 안 되는 경우입니다. 이것이 필수 요구사항이라면 자체 호스팅 가능한 도구가 유리합니다. Langfuse가 다시 언급되며, Elastic License 2.0 기반의 소스 공개형이자 OpenTelemetry 네이티브인 Arize Phoenix도 있어 계측 데이터의 이식성을 유지할 수 있습니다. LangSmith도 자체 호스팅을 지원하지만 엔터프라이즈 티어에서만 가능합니다.
- 평가 깊이: 제대로 된 메트릭 라이브러리와 LLM-as-judge가 핵심 기능으로 필요하다면 도구 간 차이가 발생합니다. Braintrust는 강력하며 자체 최적화 도구인 Loop를 제공합니다.
- 런타임 가드레일: 추적은 실행 후 무슨 일이 일어났는지 알려줍니다. 도구 호출이 실행되기 전에 차단하거나 에스컬레이션하는 것은 다른 작업이며, 많은 관측성 도구는 이를 지원하지 않습니다.
마지막 지점이 우리를 움직이게 했고, 그래서 우리는 Future AGI를 만들고 모든 것을 오픈소스로 공개하여 이 기능들을 하나로 통합했습니다. 평가, OpenTelemetry 추적, 런타임 가드레일, 도구 및 MCP 게이트웨이를 하나의 Apache-2.0 패키지로 자체 호스팅할 수 있어, 단일 실행이 여러 도구로 쪼개지지 않고 전체 과정에서 하나로 유지됩니다.
우리가 해결하려는 것은 이것입니다: 이미 LangSmith를 사용 중인 분들 중, 무엇 때문에 두 번째 도구를 추가하거나 옮기게 되었나요? 그리고 단일 도구로 다시 통합해서 만족감을 느낀 분이 계신가요, 아니면 규모가 커지면 다중 도구 설정이 현실이 되는 건가요?


