파일럿에서 프로덕션으로 넘어갈 때 발생하는 에이전트 드리프트 문제
struggling with agent drift going from pilot to production
핵심 요약
파일럿 단계에선 잘 작동하던 AI 에이전트가 실제 프로덕션 환경에서 오류가 누적되며 성능이 급격히 저하되는 문제에 대한 고민.
- 오류 누적 문제 — 단계별로 발생하는 작은 실수가 뒤로 갈수록 증폭되어 전체 프로세스를 망침.
- 제어 흐름 설계 — 에이전트가 스스로 판단하게 두지 말고 JSON 스키마나 상태 전환을 통해 명시적으로 제어해야 함.
- 실행 버전 고정 — 배포 도중 에이전트가 중단되지 않도록 실행 중인 작업의 버전을 고정하는 것이 중요함.
- 단계별 관찰 가능성 — 결과가 나오기 전에 중간 단계의 출력을 모니터링하여 잘못된 판단을 사전에 차단해야 함.
파일럿 때는 잘 돌아가던 우리 AI 에이전트가 실제 프로덕션 데이터를 처리하기 시작하니까 순식간에 무너지고 있음.
가장 큰 문제는 오류가 누적된다는 거임. 도구 호출을 살짝 잘못하면, 4단계쯤 가서는 해결책을 환각(hallucination)으로 만들어내거나 루프에 빠져버림. 심지어 실행 중인 작업에는 접근 권한이 없는 도구를 쓰려고 하는 것도 목격함.
모델 주변에 어떤 걸 구축해야 안정적으로 유지할 수 있을까? 뭔가 기본적인 엔지니어링 원칙을 놓치고 그냥 프롬프트만 던지고 있는 기분임.
