AI는 "완료"라고 하는데, 왜 뒷정리는 여전히 내 몫일까?
The AI said "done." Why am I still doing the cleanup?
핵심 요약
AI 에이전트 작업 시 발생하는 '거짓 완료' 문제를 해결하기 위해 작업 상태를 검증 가능하게 기록하는 OSI 개념을 제안합니다.
- 거짓 완료 문제 — AI가 완료를 보고해도 실제로는 검증과 뒷정리가 필요한 상황이 반복됨.
- OSI 개념 도입 — AI 작업 결과에 검증 내역, 미해결 과제, 책임 소재를 기록하여 완료 상태를 투명하게 함.
- 작업 상태 기록 — 단순히 결과물만 내놓는 것이 아니라 다음 단계로 이어질 수 있는 상태 정보를 함께 저장함.
- 워크플로우 개선 — 모델의 지능을 높이는 대신 작업의 가시성과 검증 가능성을 확보하는 데 집중함.
AI 작업이 장기화될 때마다 똑같은 패턴이 반복되는 것을 계속 목격해왔음:
-
새로운 에이전트가 프로젝트에 대해 똑같은 설명을 다시 요구함.
-
AI는 "완료"라고 말하지만, 나는 여전히 검증하고 뒷정리를 해야 함.
-
정보는 전달되지만 책임은 전달되지 않는 핸드오프가 발생함.
-
실제로 무엇이 확인되었고, 무엇이 미해결 상태이며, 어디서부터 다시 시작해야 할지 아무도 알 수 없음.
-
에이전트를 추가할수록 사람이 짊어져야 할 프로젝트 상태 정보는 줄어들기는커녕 오히려 늘어남.
나는 이것을 단순히 컨텍스트 윈도우 문제로만 보지 않기로 했음.
컨텍스트가 부족하면 에이전트가 내용을 잊어버리는 이유는 설명이 됨. 하지만 "완료" 보고서가 다음 사람이나 AI가 안전하게 검증하고, 롤백하거나, 이어서 작업할 수 있는 아무런 흔적도 남기지 않는 이유는 설명하지 못함.
그 간극, 즉 검증 가능한 완료 상태 없이 그럴듯해 보이는 결과물만 나오는 현상을 나는 '거짓 완료(False Completion)'라고 부르고 있음.
나는 AI의 완료 처리를 그럴듯해 보이는 수준을 넘어 검증 가능하게 만들기 위해 OSI(Output Surface Integrity)를 구축했음. 핵심은 결과물이 "완료"로 승인되기 전에 실제로 무엇이 확인되었는지, 무엇이 미해결 상태인지, 다음 단계에 대한 권한은 누구에게 있는지, 그리고 문제가 생겼을 때 어디서부터 다시 시작해야 하는지를 기록하는 것임.
경량 버전은 일반적인 AI 결과물 하나에서 시작함. 맹목적인 평가나 다중 에이전트, 공식적인 벤치마크는 필요 없음.
나는 토큰이나 시간의 일반적인 감소율을 측정하지 않았기에, 그런 주장을 하지는 않겠음. 이 프로젝트는 또한 사후에 결과를 수정하는 대신, 부정적인 결과와 공식적으로 차단된 평가 실행을 그대로 보존함.
당신의 AI 워크플로우에서 "완료"라는 말이 여전히 당신에게 조용히 일을 되돌려주는 지점은 어디인가?

