AI 에이전트의 가장 큰 거짓말은 자율성이 곧 가치라는 것
The biggest lie in AI agents right now is that more autonomy automatically means more value
핵심 요약
자율성보다는 안전성과 예측 가능성이 프로덕션 환경에서 훨씬 중요하다는 주장.
- 자율성의 함정 — 자율성이 높을수록 에이전트의 실수가 운영상의 큰 문제로 직결됨
- 안전한 실패 — 에이전트가 얼마나 많이 할 수 있는지보다 얼마나 안전하게 실패하는지가 중요함
- 제약의 가치 — 확인 절차를 거치고 좁은 범위 내에서 작동하는 에이전트가 실무에서 더 유용함
- 실전의 교훈 — 실제 환경의 불안정성 때문에 통제된 브라우저 환경이 더 나은 성능을 보임
사실 난 정반대라고 생각함 lol
에이전트가 자율적일수록, 실수가 발생했을 때 치러야 할 비용이 훨씬 커짐
에이전트가 단순히 텍스트만 생성할 때는, 잘못된 결과물이 나와도 그냥 짜증 나는 정도임
하지만 에이전트가 다음 작업을 시작하면:
- 이메일 발송
- 기록 수정
- 고객 데이터 접근
- 브라우저 조작
- 워크플로우 트리거
작은 실수가 순식간에 운영상의 문제로 커짐
내가 계속 눈여겨보는 건 사람들이 다음 질문에만 최적화한다는 점임: 내 에이전트가 얼마나 많은 일을 할 수 있는가
대신 다음 질문을 해야 함: 얼마나 안전하게 실패할 수 있는가
프로덕션 환경에서는 두 번째 질문이 훨씬 중요함
내가 본 최고의 시스템 중 일부는 사실 거의 "자율적"이지 않음. 그들은:
- 확인을 요청함
- 불확실할 때는 멈춤
- 행동하기 전에 검증함
- 예외 상황은 에스컬레이션함
- 매우 좁은 범위 내에서만 작동함
지루하다고? 맞음
실제로 유용하냐고? 훨씬 더 유용함
브라우저 기반 자동화를 하면서 이걸 뼈저리게 배웠음. 데모는 실제 환경의 무작위성이 나타나기 전까지는 정말 놀라워 보였음. 부분적인 페이지 로드, 만료된 세션, 사소한 UI 변경 같은 것들 말임. 에이전트가 멍청한 게 아니라, 환경이 불안정했던 거임
자율성을 쫓는 걸 멈추고 실행을 예측 가능하게 만드는 데 집중하자 상황이 빠르게 개선됐음. 더 통제된 브라우저 설정으로 옮겨가고, hyperbrowser 같은 걸 가지고 놀아보니 갑자기 더 단순한 에이전트들이 "더 똑똑한" 에이전트들보다 나은 성능을 내기 시작했음
미래는 완전 자율적인 에이전트가 아닐지도 모른다는 생각이 들기 시작함
잘 설계된 시스템 안에서 작동하는 고도로 제약된 에이전트가 미래일 것임
다른 사람들도 이런 변화를 느끼고 있는지, 아니면 내가 너무 냉소적으로 변한 건지 궁금함 lol

