프로덕션 환경에서 AI 에이전트 관측 가능성(observability)을 위해 무엇을 사용하시나요? (그리고 어떤 점이 불편한가요?)
What are you using for AI agent observability in production? (and what's broken about it?)
핵심 요약
프로덕션 환경의 AI 에이전트 관측 도구 사용 현황과 실무적인 불편 사항을 조사하는 글.
- 관측 도구 현황 — LangSmith, Langfuse, Honeycomb 등 다양한 도구 사용 사례 공유됨.
- 실무적 불편함 — 평가/실험 기능 부재나 직접적인 트레이스 확인의 비효율성이 지적됨.
- 비기술직 협업 — PM이나 고객에게 에이전트 성과를 보여주는 방식에 대한 고민이 공유됨.
- 커스텀 솔루션 — 직접 대시보드를 구축하는 것이 상용 도구보다 효율적일 수 있다는 의견이 제시됨.
다들 안녕,
사람들이 프로덕션 환경에서 에이전트 관측 가능성을 실제로 어떻게 다루고 있는지 궁금해. 문서에 나오는 거 말고, 진짜 실무 버전으로 말이야.
몇 가지 질문이 있어:
- 어떤 도구를 사용해? (LangSmith, Langfuse, Helicone, 아무것도 안 씀, 커스텀?)
- 사용하면서 가장 짜증 나는 점은 뭐야?
- 팀에 비엔지니어(PM, 고객 등)가 있다면, 그 사람들이 에이전트가 뭘 했는지 실제로 이해할 수 있어?
뭐 팔려는 거 아니고, 그냥 이 분야를 진지하게 조사 중이야. 진짜 답변만 부탁해. "그냥 print 문 써요 ㅋㅋ" 같은 답변도 유효함.


