우리 대부분은 오케스트레이션을 위해 LangChain을 선택했죠. 이제는 에이전트를 추적, 평가, 보호하는 스택을 비교해 볼 때입니다.
Most of us picked LangChain for orchestration. The next decision, the stack that traces, evals, and guards the agent, is the one worth comparing
핵심 요약
에이전트 운영의 병목 현상을 해결하기 위한 통합 플랫폼 'Future AGI'를 소개하고, 기존 도구들의 파편화된 추적 문제를 지적합니다.
- 운영 병목 현상 — 에이전트 배포 후 추적, 평가, 가드레일 도구 간의 데이터 파편화가 가장 큰 문제임
- 기존 도구 비교 — LangSmith, Langfuse, Braintrust, Guardrails AI 등 각 도구의 장단점 분석
- Future AGI 플랫폼 — 추적, 평가, 보호, 모니터링, 게이트웨이, 최적화 기능을 통합한 오픈소스 솔루션
- 모듈형 아키텍처 — 전체를 도입할 필요 없이 필요한 기능만 기존 LangChain 앱에 선택적으로 적용 가능
우리 대부분이 실제로 살아가는 패턴은 이렇다. 오케스트레이션은 순식간에 끝난다. 하루가 지나면 에이전트가 툴을 호출하고 데모에서 질문에 답까지 하니까, 다 된 것처럼 느껴지지. 그러다 실제 트래픽을 맞닥뜨리고, 엉뚱한 답변이 사용자한테 나가는 순간 진짜 프로젝트가 시작된다. 에이전트가 무슨 짓을 했는지, 결과가 맞긴 한 건지, 그리고 그 개판인 호출들을 어떻게 하면 사용자한테 닿기 전에 막을지 고민하는 거다.
그 뒷부분이 진짜 시간 잡아먹는 귀신이다. 트레이싱을 추가하면 그제야 스팬(span), 툴 호출, 지연 시간 같은 게 눈에 들어오지. 좋아. 근데 트레이스는 실행된 내용만 보여줄 뿐이야. 답변이 맞았는지는 별개의 문제니까 평가(eval) 레이어를 또 붙여야 해. 그러고 나면 위험한 툴 호출을 실행 전에 막아야 하니까 가드레일도 달아야지. 툴 3개, 대시보드 3개, 근데 보통 얘네끼리 트레이스 ID도 공유가 안 돼. 그래서 잘못된 실행 하나 복구하려면 타임스탬프 3개를 일일이 수작업으로 맞춰야 한다고.
오케스트레이션은 그냥 빠른 결정이었을 뿐이야. 진짜 모든 걸 결정하는 건 그 주변을 감싸는 레이어라고.
우리가 보는 솔직한 시장 상황은 이래. 영업용 멘트가 아니라 지도처럼 참고해.
LangSmith: LangChain이나 LangGraph를 이미 쓰고 있다면 가장 네이티브한 선택지. 트레이싱이랑 평가가 한곳에 있고, SDK도 같고, 프레임워크랑 딱 붙어 있음.
Langfuse: 오픈소스 가시성 확보의 일꾼. 직접 호스팅 가능하고, OTel 친화적이며, 락인(lock-in) 없이 트레이스랑 토큰/비용 추적하기에 아주 강력함.
Braintrust: 평가 우선주의. CI에서 프롬프트 점수 매기거나 회귀 테스트할 때 강점이 있고, 실시간 가드레일 쪽은 좀 가벼운 편.
Guardrails AI: 오픈소스고, 인라인 입력/출력 검증에 집중함. 모델 바로 앞에 붙이는 깔끔한 안전 장치.
우리는 어디에 위치하냐고? 우리는 Future AGI를 만드는데, 핵심은 Apache 2.0 라이선스 오픈소스야. 게이트웨이, 트레이싱 라이브러리, 평가 라이브러리를 하나로 묶은 레포지토리 하나지. 이 작업에선 오픈소스라는 게 진짜 중요해. 어떤 툴 호출이 안전한지, 결과물이 좋은지 판단하는 놈이 네 신뢰 경로 한복판에 앉아 있잖아. 그러니까 당연히 코드를 읽어보고, 포크해서, 네 인프라에서 돌릴 수 있어야지. 데이터도 네 쪽에 그대로 남겨두고 말이야.
플랫폼 구조는 이래
Future AGI는 6개의 플랫폼 레이어로 구성돼 있어:
- Simulate: 텍스트와 음성 워크플로우를 포함해 페르소나, 적대적 입력, 예외 케이스 전반에 걸친 다회차 테스트.
- Evaluate: 근거성, 환각, 툴 사용 정확도, PII, 어조, 커스텀 기준 등 50개 이상의 지표 제공.
- Protect: 탈옥, 프롬프트 인젝션, 개인정보 보호, 정책 검사 등을 위한 18개의 내장 스캐너와 15개의 벤더 어댑터.
- Monitor: LangChain을 포함한 50개 이상의 프레임워크에 걸친 OpenTelemetry 네이티브 트레이싱, 지연 시간, 토큰 비용, 스팬 그래프, 대시보드 제공.
- Agent Command Center: 100개 이상의 제공업체, 라우팅 전략, 시맨틱 캐싱, 가상 키 MCP, A2A 지원을 갖춘 OpenAI 호환 게이트웨이.
- Optimize: GEPA와 PromptWizard를 포함한 6개의 프롬프트 최적화 알고리즘. 프로덕션 트레이스가 다시 최적화 워크플로우로 피드백됨.
쉽게 말해서, 개별 툴들은 자기 영역만 잘하는데 Future AGI는 에이전트 주변의 전체 프로덕션 루프를 다 커버한다는 소리야.
이게 단일 실행에서 뭘 해주냐면, 시나리오를 재현하고, OTel 기반 트레이싱(traceAI)으로 모든 스팬을 추적하고, 같은 트레이스 ID에 붙은 평가로 결과 점수를 매기고, 위험한 툴 호출을 차단하고, 요청을 다른 모델로 라우팅하고, 실패 사례를 다시 프롬프트 튜닝으로 피드백해. 점수가 실행이랑 같은 기록에 남으니까 툴 3개 사이에서 타임스탬프 맞추느라 고생할 필요가 없는 거지.

