AI 프로젝트에서 다들 쉬쉬하지만 내가 계속 목격하는 문제
Something I keep seeing with AI projects that nobody talks about openly
핵심 요약
AI 에이전트 프로젝트가 실패하는 주된 이유는 '성공'과 '실패'에 대한 명확한 정의 없이 배포하기 때문이라는 지적.
- 성공 정의 부재 — 배포 전 '잘 작동한다'는 기준을 세우지 않아 발생하는 문제
- 에이전트 복잡성 — 단순 챗봇과 달리 해석과 행동을 수행하며 예상치 못한 오류 발생
- 실패 기준 설정 — 답변하지 말아야 할 상황과 에스컬레이션 시점을 정의하는 것이 필수적임
- 평균의 함정 — 높은 평균 성능이 치명적인 오류를 상쇄할 수 없음을 인지해야 함
안녕하세요! AI 에이전트를 출시하려는 팀들과 많은 대화를 나눈 후, 제 머릿속을 떠나지 않는 생각을 공유하고 싶습니다.
AI 프로젝트의 80% 이상이 실제 운영 환경에서 실패한다는 통계가 자주 언급됩니다. 하지만 왜 실패하는지에 대해서는 아무도 이야기하지 않죠.
쉬운 대답은 "모델이 충분히 좋지 않았다"거나 "데이터가 나빴다"는 것입니다. 때로는 맞는 말이죠. 하지만 제가 계속 목격하는 것은 다릅니다. 팀들이 '잘 작동한다'는 것이 실제로 무엇을 의미하는지 정의하지도 않은 채 출시한다는 점입니다.
그들은 몇 가지 프롬프트를 테스트합니다. 데모는 좋아 보이죠. 회의에서 누군가 "탄탄해 보이네"라고 말합니다. 그리고 바로 라이브로 나갑니다.
문제는 AI 에이전트가 정적인 시스템이 아니라는 겁니다. 챗봇은 응답만 하지만, 에이전트는 해석하고, 결정하고, 행동합니다. 더 많은 일을 할수록 문제가 발생할 수 있는 표면적 영역이 넓어지는데, 이는 뻔한 방식이 아니라 미묘한 방식으로 나타납니다. 데모에서는 환각(hallucination)을 일으키지 않다가, 아무도 테스트할 생각을 못한 엣지 케이스에서 환각을 일으키죠. 95%의 경우 제대로 에스컬레이션하지만, 나머지 5%에서는 고객이 완전히 틀린 답변을 확신에 찬 어조로 받게 됩니다.
대부분의 출시 과정에서 실제로 빠져 있는 것은 출시 전 '실패'에 대한 정의라고 생각합니다. 단순히 "정확하게 답변하는가"가 아니라, 답변하지 말아야 할 때를 아는가? 필요할 때 에스컬레이션하는가? 대화가 예상치 못한 방향으로 흘러갈 때 경계를 지키는가? 같은 것들 말이죠.
좋은 평균 점수가 치명적인 오류를 상쇄해주지는 않습니다. 바로 그 부분이 간과되고 있습니다.
통제된 테스트에서의 AI 에이전트 성능과 실제 사용자들이 사용하기 시작했을 때 발생하는 현상 사이의 이런 괴리를 느끼고 계신 분 또 계신가요?
