AI 자동화 결과물을 사람이 일일이 확인해야 한다면, 그건 자동화가 아니라 업무 위치만 바꾼 것이다.
If a human has to check everything your AI automation does, you didn't automate the process. You just moved the work.
핵심 요약
AI 자동화의 진정한 성공 지표는 모델 정확도가 아니라 인간의 검토 시간을 얼마나 줄였는지에 달려 있다는 통찰.
- 자동화의 함정 — 95% 정확도는 5%의 치명적 오류를 찾아내기 위해 100% 검토를 강제함.
- 성공 지표 — 모델 정확도보다 인간의 검토 시간(review minutes)을 측정하는 것이 중요함.
- 예외 처리 — 시스템이 확신할 수 없는 경우만 인간에게 넘기는 방식이 실질적인 자동화임.
- 업무 효율화 — 인간의 개입을 최소화하고 예외 상황에만 집중하게 만드는 것이 핵심임.
3월에 빌드 상태 좀 보려고 클라이언트 사무실에 들렀거든. 사무실 관리자인 데이나는 모니터 두 개를 띄워놓고 있었어. 왼쪽엔 AI가 뽑아낸 결과물, 오른쪽엔 고객이 보낸 원본 이메일, 그리고 가운데엔 리걸 패드(legal pad)를 놓고 손으로 일일이 체크하고 있더라고. 나를 보더니 남의 숙제 검사해주는 사람 특유의 피곤하고 예의 바른 표정을 짓는데, 그 '남'이 바로 나라는 걸 깨달았지.
난 8년 동안 제품을 만들어왔어. 창업자들을 위한 MVP부터, 본격적인 프로덕션 빌드, 남들이 버린 시스템 재구축, 소상공인을 위한 자동화까지 안 해본 게 없지. 이 클라이언트는 일주일에 견적서를 80개 정도 뽑는 업체였는데, 내가 사장들이 맨날 나한테 해달라고 조르는 그 시스템을 만들어줬거든. 들어오는 구매 주문서를 읽어서 자동으로 견적서 초안을 짜주는 시스템 말이야. 테스트할 땐 정확도가 95%가 나왔고, 회의실에서 데모 보여줄 땐 박수까지 받았다고.
근데 현실에서의 95%는 일주일에 4개는 틀린다는 소리잖아. 문제는 그 4개가 뭔지 아무도 모른다는 거지. 그래서 데이나는 매일 아침 80개를 전부 다 확인하고 있었어. 큰 거래처에 견적서 하나 잘못 보냈다간 소프트웨어로 아낀 돈보다 훨씬 큰 손해가 나니까.
솔직히 말할게. 처음엔 95%라는 수치를 방어하고 싶었어. 근데 데이나의 타임시트를 같이 보는데 속이 좀 쓰리더라. 원래는 견적서 쓰는 데 일주일에 8시간을 썼는데, 지금은 그거 검토하는 데만 6시간 반을 쓰고 있는 거야. 심지어 AI가 저지르는 실수는 예전에 사람이 하던 실수보다 훨씬 이상했어. 절대 틀릴 리 없는 품목의 단위를 틀리질 않나, 절대 할인 안 해주는 고객한테 할인을 넣어주질 않나. 결국 내가 한 짓은 90분 정도 업무를 자동화해주고, 실수를 더 기괴하게 만든 뒤에 돈을 받아 챙긴 꼴이었지.
해결책은 정확도를 더 높이는 게 아니었어. 시스템이 스스로 '확신이 없을 때'를 알게끔 가르쳤지. 단골 고객이 평소처럼 주문하면 그냥 바로 통과시켜. 근데 뭔가 새로운 게 있거나 패턴에서 조금이라도 벗어나면 바로 나가는 게 아니라 검토 대기열로 보내버리는 거야. 일주일에 한 12개 정도가 그 대기열에 걸리거든. 데이나는 그 12개만 매의 눈으로 확인하고 나머지는 아예 쳐다보지도 않아. 그 '무시해도 된다'는 게 이 제품의 핵심이야.
이제 난 모든 빌드마다 자체 감사를 하나 돌려. 기계가 만든 걸 사람이 검토하는 데 들어가는 시간을 다 더해보는 거지. 만약 그 시간이 원래 업무 시간과 비슷하다면, 그건 일이 해결된 게 아니야. 그냥 책상만 옮겨간 거지.
참고로 데이나는 아직도 리걸 패드를 서랍에 넣어두고 있어. 아직 나를 완전히 믿지는 못하는 눈치인데, 솔직히 그게 맞는 것 같기도 해.

