고객을 위해 LangChain 에이전트를 배포했는데...
We deployed a LangChain agent for a client.
핵심 요약
LangChain 에이전트 배포 후 툴 타임아웃으로 인한 환각 현상과 2,400달러의 비용 손실을 겪으며 배운 관측 가능성(observability)의 중요성.
- 툴 타임아웃 문제 — 툴 호출 실패 시 에이전트가 에러를 내지 않고 환각 답변을 생성함
- 비용 손실 발생 — 문제 파악 전까지 LLM 사용료로 2,400달러가 지출됨
- 관측 가능성 확보 — 툴 호출, LLM 토큰 사용량, 세션 비용 등 상세 로깅의 필요성
- 테스트 전략 개선 — 단순 부하 테스트보다 툴 응답 지연 등 엣지 케이스 시뮬레이션이 중요함
제목: 고객을 위해 LangChain 에이전트를 배포했는데...
조용히 30%의 세션에서 2주 동안 실패하고 있었음.
우리가 배운 점들.
B2B SaaS 고객을 위한 고객 지원 에이전트를 구축함.
LangChain + GPT-4o 조합이었고, 스테이징에서는 탄탄해 보였음.
프로덕션 1주 차: 고객이 "사용자들이 봇이 가끔 이상한 답변을 한다고 불평한다"고 함.
우리는 가시성이 전혀 없었음. 트레이스도 없고, 세션 로그도 없고, 아무것도 없었음. 그냥 느낌과 console.log뿐.
무슨 일이 일어나고 있는지 파악하려고 3일 동안 수동 로깅을 추가함. 알고 보니 사용자 컨텍스트를 가져오는 툴 호출이 조용히 타임아웃되고 있었음 — 에이전트는 재시도하는 대신 답변을 환각하고 있었던 거임.
문제를 잡기 전까지 LLM 비용으로 2,400달러가 나감.
이제 우리가 배포하는 모든 에이전트에 계측하는 것들:
- 모든 툴 호출: 입력, 출력, 지연 시간, 성공/실패 여부
- 모든 LLM 호출: 프롬프트 토큰, 완료 토큰, 비용
- 세션 단위 비용 집계
- 툴별 에러율
당신들의 프로덕션 에이전트 관측 스택은 어떻게 생겼음? 다른 사람들은 어떻게 하고 있는지 궁금함.



