AI 에이전트를 몇 달간 개발해보니, 진짜 중요한 게 뭔지 생각이 바뀌었다.
After months of building agents, I've changed my mind about what matters most.
핵심 요약
AI 에이전트 실무에서는 모델 성능보다 모니터링, 상태 관리, 오류 처리 같은 오케스트레이션이 훨씬 중요하다는 경험담.
- 에이전트 실무 — 프로토타입과 실제 운영 환경의 괴리가 큼
- 모델 성능 — 대부분의 최신 모델은 이미 충분히 똑똑함
- 핵심 과제 — 루프 방지, 컨텍스트 유지, 예외 처리 등 오케스트레이션이 관건
- 지루한 작업 — 프롬프트 튜닝보다 모니터링과 재시도 로직이 더 중요함
AI 에이전트를 프로덕션 환경에 올리는 게 얼마나 어려운지 다들 과소평가하는 것 같다.
데모 만드는 건 쉽다.
수천 번 실행해도 안정적으로 돌아가는 걸 만드는 게 진짜 흥미로운 부분이다.
몇 달 전만 해도 더 좋은 모델이 대부분의 문제를 해결해 줄 거라 생각했다.
하지만 아니었다.
가장 큰 문제는 지능과 전혀 상관없었다.
에이전트가 루프에 빠지는 것.
단계 사이에서 컨텍스트를 잃어버리는 것.
이상한 엣지 케이스에서 실패하는 것.
언제 멈추고 사람에게 도움을 요청해야 할지 모르는 것.
우리는 프롬프트 개선보다 안전장치와 복구 메커니즘을 만드는 데 훨씬 더 많은 시간을 썼다.
놀라웠던 점은 모델이 병목 현상의 원인인 경우가 거의 없었다는 것이다.
요즘 모델들은 대부분 많은 작업에 충분히 훌륭하다.
어려운 건 그 주변의 모든 것들이다.
모니터링.
상태 관리.
재시도.
핸드오프.
실패 처리.
즉, 지루한 작업들이다.
에이전트 시스템을 다룰수록 모델에서 성능 몇 퍼센트 더 짜내는 것보다 안정적인 오케스트레이션이 훨씬 중요하다는 확신이 든다.
다른 사람들도 그렇게 생각하는지 궁금하다.
프로토타입에서 실제 사람들이 사용하는 서비스로 넘어갈 때 가장 힘들었던 부분은 무엇인가?

