AI 에이전트가 실제로 작업을 수행했는지 어떻게 확신할 수 있을까?
How do you actually know your AI agent did what it says it did?
핵심 요약
AI 에이전트의 작업 결과에 대한 신뢰성 문제와 이를 검증하기 위한 '영수증' 개념의 필요성을 논의합니다.
- 신뢰성 문제 — 에이전트가 실제로 작업을 수행했는지 검증할 방법이 부족함
- 영수증 개념 — 모델, 입력, 출력을 제3자가 검증할 수 있는 증거의 필요성
- 검증 도구 — OpenGradient와 같은 ZKML 기술을 활용한 작업 증명 시도
- 인적 개입 — 중요한 작업에는 여전히 인간의 검토와 승인이 필수적이라는 의견
에이전트로 뭘 만들면 만들수록 계속 거슬리는 게 하나 있음.
에이전트가 알아서 이것저것 다 처리하고 나한테 요약본 하나 툭 던져주잖아. 데이터 분석 다 끝냈고 이게 결론이라는 자신감 넘치는 문단 하나 딱 오는데… 이걸 그냥 믿어야 함? 실제로 어떤 모델이 돌아갔는지, 뭘 확인했는지, 아니면 그냥 일한 척 뻥을 치는 건지 확인할 방법이 전혀 없음.
글쓰기 보조 도구라면야 뭐 상관없지. 근데 요즘 사람들은 돈을 옮기거나, 메시지를 보내거나, 되돌리기 귀찮은 결정을 내리는 진짜 업무를 에이전트한테 맡기고 있음. 그 시점에서 "나 믿고 맡겨, 다 했어"라는 식의 접근은 좀 위험한 거 아님?
내가 계속 바라는 건 '영수증'임. 에이전트가 지 입으로 쓰는 로그 말고(이건 똑같이 못 믿을 놈이니까), 에이전트가 조작할 수 없는 무언가가 필요함. 어떤 모델이 돌아갔는지, 뭐가 입력됐고 뭐가 나왔는지, 현장에 없던 제3자도 검증할 수 있는 그런 거.
물론 영수증이 있다고 에이전트가 항상 옳다는 건 아님. 모델이 제대로 돌아갔어도 결과는 개판일 수 있으니까. 그냥 '잘못된 결정'을 내린 건지, 아니면 '애초에 아무 일도 안 한 건지'를 구분할 수 있게 해준다는 거지.
다들 이거 어떻게 처리하고 있음? 그냥 로그 다 찍어놓고 기도 메타임?
edit: "영수증" 같은 게 존재하냐고 묻는 사람들 있어서 말하는데, 내가 찾은 것 중엔 OpenGradient가 제일 비슷함. 추론할 때마다 모델, 입력값, 출력값을 묶어서 증명을 붙여주는데, 에이전트가 직접 쓰는 로그가 아니라 제3자가 검증할 수 있는 방식임. 지연 시간도 생기고 큰 모델은 zkml 비용이 좀 나가긴 하지만, 어쨌든 일이 실제로 일어났다는 건 증명해주니까. 내가 딱 원하던 게 이거임.

