LangGraph/LangChain 프로젝트의 시각화 문제 해결을 위한 고민
Trying to solve visualization pain for LangGraph/LangChain projects
핵심 요약
AI 에이전트 시스템의 실질적인 운영상 어려움을 파악하여 오픈소스 솔루션을 개발하려는 개발자의 질문입니다.
- 오픈소스 개발 — 실질적인 프로덕션 문제 해결을 위한 자가 호스팅 솔루션 구축 시도
- 운영 환경 — LangGraph 기반 7개 에이전트 시스템을 Redis pub/sub으로 3개월간 운영
- 관측 가능성 — Prometheus와 OpenTelemetry, TimescaleDB를 활용한 자체 모니터링 파이프라인 구축
- 피드백 요청 — 대규모 AI 에이전트 시스템 운영 시 겪는 디버깅, 오케스트레이션, 신뢰성 문제 조사
지난주부터 저는 오픈소스 자가 호스팅 솔루션을 만들 만한 가치가 있는 AI 에이전트 시스템의 실질적인 프로덕션 문제점을 찾고 있습니다.
처음에는 AI가 생성한 조사 결과와 브레인스토밍에 너무 의존했는데, 그러다 보니 실제 엔지니어링 문제에 기반한 설득력 있는 제품 사양을 도출하기가 어려웠습니다.
배경을 설명하자면, 저와 제 팀은 지난 3개월 동안 LangGraph 기반 워크플로우를 프로덕션 환경에서 운영해 왔습니다. 이 시스템은 Redis pub/sub 이벤트를 통해 트리거되며, 실행될 때마다 상태가 갱신되는 7개의 에이전트로 구성되어 있습니다.
저희의 사용 사례는 비교적 단순했습니다:
- 장기적인 대화 메모리 없음
- 검색 도구 없음
- 실행 간 과거 기록 조회 불필요
그렇기 때문에 많은 사람들이 언급하는 시각화나 오케스트레이션 관련 문제들을 실제로 겪지는 않았습니다.
관측 가능성(observability)을 위해 저희는 Prometheus와 OpenTelemetry를 사용하여 자체 모니터링 파이프라인을 구축했고, 노드/스팬 데이터를 TimescaleDB에 저장하여 익스포터를 통해 노출했습니다. 이 설정은 루프 추적, 토큰 사용량, 지연 시간 병목 현상, 워크플로우 신뢰성을 파악하는 데 매우 유용했습니다.
이제 저는 해결되지 않은 진짜 문제들이 어디에 있는지 이해하고자 합니다.
AI 에이전트, 멀티 에이전트 시스템, LangGraph, Temporal, CrewAI 또는 이와 유사한 도구를 프로덕션 환경에서 사용해 보셨다면 다음 질문에 답변 부탁드립니다:
- 규모가 커지면서 무엇이 고통스러웠나요?
- 어떤 가시성/디버깅 문제를 겪으셨나요?
- 어떤 도구가 있었으면 좋겠다고 생각하셨나요?
- 어떤 점이 자가 호스팅 오픈소스 솔루션을 도입하게 만들까요?
저는 특히 관측 가능성, 오케스트레이션, 신뢰성, 평가, 메모리 추적, 프로덕션 모니터링과 관련된 문제들에 관심이 많습니다.

