AI 에이전트 구축에서 가장 어려운 부분은 AI와 아무 상관이 없다
The hardest part of building AI agents has nothing to do with AI
핵심 요약
AI 에이전트의 성공은 모델 성능보다 데이터 검증, 실패 처리, 그리고 실제 업무 프로세스에 대한 깊은 이해에 달려 있습니다.
- 자동화 타당성 검토 — 업무가 일관된 입력과 명확한 출력 기준을 갖췄는지 먼저 확인해야 함
- 실패 경로 설계 — 성공 사례보다 잘못된 입력이나 예외 상황을 처리하는 로직을 먼저 구축해야 함
- 현장 관찰의 중요성 — 실제 업무 수행자를 관찰하여 문서화되지 않은 암묵적 예외 사항을 파악해야 함
- 비용 대비 효율 — 자동화 도입 전 해당 업무의 실제 비용을 계산하여 경제성을 따져봐야 함
이게 내 본업인데, 온라인에 올라오는 결과물이랑 실제 작업 현장 사이의 괴리가 갈수록 커지고 있어. 화려한 겉모습은 다 빼고, 내가 지금 실제로 쓰는 방식이랑 현실적인 조언 좀 적어볼게.
모델 만드는 건 이제 어려운 축에도 못 껴. 일주일 만에 데모 뽑아내는 건 아무것도 아니라고. 진짜 어려운 건 데이터, 에러 처리, 그리고 업무 인수인계야.
툴 고르기 전에, 이 작업이 자동화가 가능한지부터 확인해. 최소 일주일에 몇 번은 돌아가는지, 입력 데이터 형식이 일정한지, "상황에 따라 달라요"라는 말 없이 한 페이지로 절차를 정리할 수 있는지, 그리고 결과물이 맞았는지 당일에 바로 확인할 수 있는지. 이 중에 세 개 이상이 '아니오'라면, 그건 아직 자동화할 단계가 아니야. 그냥 프로세스부터 다듬어야지. 그게 훨씬 싸게 먹히거든.
해피 패스(성공 경로)보다 실패 경로를 먼저 짜. 데모는 그냥 돌아가기만 하면 되지만, 진짜 에이전트는 실패를 제대로 해야 해. 내가 뭐든 배포하기 전에 꼭 넣는 세 가지가 있어. 첫째, 입력값이 이상하면 추측하지 말고 바로 뱉어내는 검증 단계. 둘째, 멍청하게 즉흥적으로 처리하지 말고 멈춰서 사람한테 넘기는 명확한 탈출구. 셋째, 새벽 2시에 무슨 일이 일어났는지 복구할 수 있게 입력값과 결정 과정을 기록하는 로그. 이렇게 하면 에이전트는 눈에 띄게 멍청해지지만, 대신 엄청나게 쓸모 있어져. 2주 동안 조용히 틀린 결과 내놓는 것보다, 첫날에 대차게 에러 터지는 게 백번 나아.
사람들이 말하는 프로세스는 절대 실제 프로세스가 아니야. 다들 기억에 의존해서 예쁘게 포장해서 말하거든. 진짜 업무에는 다들 말 안 하는 예외 상황이 널렸어. 왜냐고? 그 사람들한테는 그게 예외가 아니라 그냥 일상이니까. 직접 한 시간만 옆에 앉아서 일하는 거 지켜봐. 이상한 상황 닥치면 어떻게 하는지 물어보고. 그 한 시간이 몇 주를 아껴줘. 나도 귀찮아서 건너뛸 때마다 나중에 꼭 대가를 치르더라.
범위 잡을 때 내가 지키는 원칙은 이거야. 첫 빌드는 무조건 한 단계만, 빈도 높고, 지루하고, 금요일까지 검증 가능한 걸로 해. "우리 운영 전체 자동화" 같은 거 하지 말고. 작게 만들어서 배포해야 다음 걸 할 수 있는 신뢰가 쌓여. 거창하게 시작하면 6개월짜리 프로젝트 되다가 흐지부지 끝나고, 그 회사 자동화 분위기만 몇 년 동안 망치는 거야.
인수인계 안 되면 그건 만든 게 아니야. 담당자 한 명 나가서 아무도 이게 어떻게 돌아가는지 설명 못 하면, 그건 그냥 빚덩어리야. 그쪽 팀 사람 중 한 명이라도 이게 뭘 하는지, 어디서 터지는지 설명할 수 있어야 비로소 끝난 거야.
그리고 뭐 사기 전에 물어봐야 할 건 어떤 툴을 쓸지가 아니야. 지금 이 작업에 돈이 얼마나 드는지를 따져봐야지. 시간 계산하고, 그 사람 시급 곱해서 비교해 봐. 대부분은 이 계산도 안 해보고 덤비는데, 절반 정도는 그냥 자동화 안 하는 게 낫다는 결론이 나올걸.
그렇다고 만들지 말라는 소리는 아니야. 성과는 확실하고, 쌓이면 엄청나거든. 다만 그 성과는 다들 하기 싫어하는 지루한 부분에서 나오고, 그 지루한 부분이 전체 일의 대부분이라는 거지.
너네는 배포할 때 뭐가 제일 골치 아팠어? 나는 아직도 깨끗한 척하는 더러운 입력 데이터 때문에 제일 많이 데여.