에이전트 워크플로우를 프로덕션에서 실행하기?
Running Agentic workflows in Production?
핵심 요약
AI 에이전트의 프로덕션 실패 원인 분석과 이를 해결하기 위한 의사결정 재구성 및 검증 전략 논의.
- 실패 원인 — 다단계 체인의 오류 누적, 조용한 도구 실패, 할루시네이션 등이 프로덕션 전환을 방해함.
- HITL의 중요성 — 에이전트가 제안하고 인간이 최종 결정하는 구조가 자동화의 신뢰성을 높이는 핵심임.
- 의사결정 재구성 — 단순 트레이싱을 넘어 결정 시점의 정책, 프롬프트, 컨텍스트 스냅샷을 저장해야 함.
- Durable Execution — 모든 단계를 영속화하여 상태를 유지하면 재시도 처리와 디버깅이 훨씬 빨라짐.
95%의 AI 파일럿이 프로덕션 단계에서 P&L(손익)에 아무런 영향을 주지 못한 채 실패합니다. 실제로 무엇이 문제를 일으키는지 궁금합니다.
보통 어디에서 실패하나요?
- 다단계 체인 (오류가 빠르게 복리처럼 쌓임)
- 조용한 도구 실패 (에이전트는 호출했다고 하지만 안 했거나, 도구가 200 OK와 함께 성공을 반환했지만 실제로는 실패한 경우)
- 잘못된 형식의 출력
- 아무도 잡지 못한 할루시네이션
- 그 외 다른 것?
현재는 어떻게 디버깅하시나요?
- LangSmith, Arize, 커스텀 로그?
- 그냥 트레이스를 뒤져보나요?
실제로 무엇이 도움이 될까요? "더 나은 관측성(observability)" 말고, 시간을 가장 많이 아껴줄 수 있는 것이 무엇일까요?
이 분야에서 무언가를 만들고 있습니다. 무엇이 가장 고통스러운지, 그리고 무엇이 실제로 그것을 해결할 수 있을지 알고 싶습니다.


