AI 에이전트 프레임워크는 훌륭하지만, 프로덕션 환경에선 전부 무너짐. 반박 환영.
AI agent frameworks are great. Production is where they all fall apart. Change my mind.
핵심 요약
AI 에이전트 프레임워크는 프로토타이핑엔 유용하지만, 프로덕션 환경의 예기치 못한 중단과 재시도 문제로 인해 실사용이 매우 어려움.
- 프레임워크 한계 — LangChain 등은 빠른 개발엔 유용하지만 프로덕션 환경의 복잡한 예외 상황을 처리하지 못함.
- 부분 실행 문제 — Pod 재시작 시 에이전트 작업이 중간에 멈춰 부작용을 일으키고 복구가 불가능함.
- 재시도 로직 부재 — 에이전트 단계가 멱등성을 고려하지 않아 재시도 시 데이터 오염이나 중복 작업이 발생함.
- 배포 및 버전 관리 — 실행 중인 에이전트가 있는 상태에서 배포할 때 버전 관리와 상태 유지가 매우 까다로움.
LangChain, LangGraph, CrewAI는 빠르게 무언가를 만들어내기엔 정말 좋음. 프레임워크를 까려는 게 아님.
하지만 프로덕션에 배포하는 순간 이야기가 달라짐.
실행 도중에 Pod가 재시작되면 전체가 초기화됨. 일부 단계는 이미 실행된 상태라, 작업을 마무리할 에이전트 없이 부작용만 남게 됨.
재시도는 간단해 보이지만, 대부분의 에이전트 단계가 두 번 이상 실행되도록 설계되지 않았다는 걸 깨닫는 순간 문제가 됨. 재시도할 때쯤이면 이미 피해는 발생한 뒤임.
실행 중인 작업이 있는데 새 버전을 배포하는 상황. 뭔가 고장 나기 전까지는 아무도 생각하지 못한 버전 관리 로직.
프레임워크 자체는 괜찮음. 문제는 아무도 경고해주지 않은 그 주변의 모든 것들임.
다들 프로덕션에서 이걸 어떻게 처리하고 있음?


