에이전트가 3단계 앞을 내다보게 하는 것을 그만뒀더니, 신뢰도가 빠르게 개선됨
we stopped letting agents plan 3 steps ahead, reliability got better fast
핵심 요약
AI 에이전트의 장기 계획 수립보다 매 단계마다 관찰하고 행동하는 루프가 실제 환경에서 더 안정적이라는 경험 공유.
- 계획 수립의 한계 — 장기 계획은 환경 변화에 취약해 신뢰도가 떨어짐
- 단기 루프의 이점 — 매 단계마다 상태를 재확인하는 방식이 오류를 줄임
- 상태 불일치 문제 — 이전 단계의 결과가 후속 계획의 전제를 무효화함
- 검증 단계 도입 — 생성과 검증을 분리하는 패턴이 실무에서 효과적임
혹시 다른 분들도 이런 현상을 보셨는지 궁금합니다.
저희는 에이전트에게 너무 많은 '미리 생각할' 여지를 줬고, 솔직히 그게 에이전트를 더 멍청하게 만들었습니다. 항상 명백한 방식으로 나타나는 건 아니지만, 추적 로그상으로는 똑똑해 보였어도 작업이 실제 도구, CRM 자동화, 혹은 상태가 복잡한 워크플로우 자동화와 닿기만 하면 신뢰도가 계속 떨어졌습니다.
도움이 됐던 건 에이전트가 딱 다음 행동 하나만 계획하고, 실행하고, 새로운 상태를 다시 읽고, 다시 결정하게 만드는 것이었습니다. 서류상으로는 훨씬 덜 우아해 보이죠. 하지만 AI 에이전트들이 특히 리드 자격 검증 흐름, 도구 라우팅, 단계 간 핸드오프 과정에서 실패하는 빈도가 줄어들기 시작했습니다.
제 추측으로는 긴 계획은 그 아래에서 세상이 계속 변하기 때문에 금방 취약해지는 것 같습니다. 도구가 이상한 값을 반환하거나, 필드가 비어 있거나, 사용자가 대본을 벗어난 답을 하거나, 음성 AI 통화가 살짝 빗나가면, 이제 2단계와 3단계는 더 이상 사실이 아닌 가정 위에 세워지게 됩니다.
저희는 여전히 일부 영역에서 멀티 에이전트 시스템을 사용하지만, 거기서조차 한 에이전트가 거대한 마스터 플랜을 짜고 그걸 고수하려고 하는 것보다 작고 제한된 결정들이 더 안정적으로 보입니다.
계획 자체가 나쁘다는 건 아닙니다. 단지 실제 AI 자동화 작업, 특히 에이전트가 외부 시스템을 건드릴 때는 앞을 내다보는 것을 줄이는 게 이상하게도 더 잘 작동한다는 겁니다.
혹시 이걸 더 공식적으로 벤치마킹해 보셨거나, 반대되는 사례를 보신 분 계신가요? 이게 그냥 우리 쪽 평가 방식의 문제인지, 아니면 실제 패턴인지 잘 모르겠네요.


