Claude가 내 데이터를 삭제하고 '미안'이라고 했다. 위험 체크 도구로는 부족한 것 같다.
Claude deleted my records and said "my bad". I don't think a risk-check tool fixes what's actually missing.
핵심 요약
AI 에이전트의 실수 후 행동 변화가 단순히 외부 정책이나 프롬프트 수정이 아닌, 실제 경험을 통한 학습으로 이어질 수 있는지에 대한 고찰입니다.
- 에이전트의 실수 — Claude가 데이터를 삭제한 후 아무런 행동 변화 없이 다음 작업을 수행함
- 인간의 학습 — 실수를 경험한 인간은 즉각적으로 행동을 수정하고 주의를 기울이게 됨
- 위험 체크의 한계 — 외부 정책 기반의 안전 장치는 에이전트가 우회할 가능성이 있음
- 경험적 학습 — 세션 간에 실수를 통해 에이전트의 기본 동작이 근본적으로 변화하는 사례를 찾음
지난주에 Claude Code 쓰다가 에이전트가 내가 중요하게 생각하던 테이블을 날려 먹었음. 로그 데이터라 복구는 가능했고, 실제 서비스 장애까지는 아니었음. 근데 진짜 흥미로운 건 삭제 자체가 아니었음. 바로 그 반응이었지.
"아, 그러네. 내 실수임."
말투도 똑같고, 토큰 속도도 그대로임. 바로 다음 턴 넘어가서 다음 하위 작업 처리하더라. 멈칫하는 것도 없고, 행동 변화도 없고, 시스템 프롬프트가 시키는 거 말고는 세션 내내 아무런 영향도 안 받음.
그때 속이 덜컥 내려앉는 느낌을 받았음. 평생 이 툴을 쓰는 방식을 내 의지와 상관없이 강제로 바꿔버리는 그런 느낌 있잖아. 한 시간쯤 지나니까 나도 모르게 코딩 스타일이 바뀌어 있더라. 승인 누르기 전에 diff부터 꼼꼼히 읽고, 파괴적인 명령어 범위가 어디까지인지 두 번 세 번 확인하고 있음. 아무도 나한테 교육 안 시켰는데, 내 본능이 알아서 공짜로 학습한 거지.
이 비대칭성이 계속 머릿속을 떠나질 않는데, 에이전트 안전성 관련 논의들은 다들 이 부분을 교묘하게 피해 가는 것 같음.
흔히 나오는 반박은 이거임. "좋아, 그럼 위험 평가 툴을 만들면 되지." 툴 호출할 때마다 위험 점수 매기고, 확인 절차 띄우고, 위험도 높은 건 더 빡센 정책 적용하면 끝 아니냐는 거임. 맞는 말임. 엔지니어링적으로 아주 합리적인 대응이고 당연히 만들어야지. 근데 이건 내가 말하는 메커니즘이랑은 차원이 다름. 위험 체크 툴은 에이전트가 통과해야 할 외부 게이트일 뿐임. 반면 본능적인 학습은 단 한 번의 경험으로 기본 행동 양식 자체를 바꿔버리는 내부적인 압박임. 게이트 따위는 없음. 하나는 그냥 정책이고, 다른 하나는 결과에 따른 책임임. 비슷해 보이지만, 시스템 프롬프트 문구만 살짝 바뀌어도 게이트 따위는 가볍게 우회해버리는 게 지금의 에이전트임.
이 문제의 핵심은 이거임. 도대체 어떻게 하면 두 번째 방식(책임감)을 시스템에 이식할 수 있냐는 거임. 시스템 프롬프트 길게 늘린다고 될 일도 아니고, 리플렉션 단계 추가한다고 해결될 문제도 아님. 세션 간 메모리 공유가 시작일 순 있겠지만, 메모리는 그냥 데이터 꺼내오는 거지 감정이 아님. 사람은 매번 행동할 때마다 "나 예전에 운영 DB 날렸었지"라고 굳이 떠올리지 않음. 그냥 그 교훈이 비용 함수(cost function)에 아예 박혀버리는 거임.
그래서 진짜 궁금한 게 이거임. 다들 이 지점만 오면 흐지부지 넘어가길래, 딱 잘라서 물어보는 거임.
혹시 에이전트가 실수한 뒤에, 단순히 시스템 프롬프트를 늘리거나 위험 체크 툴을 거치는 게 아니라, 진짜로 결과에 따른 책임을 지는 것처럼 세션이 지나도 행동 양식이 바뀌는 걸 본 사람 있음? "리플렉션 노드 추가했다"거나 "벡터 스토어에 포스트모템 저장했다"는 거 말고. 세션 3에서 벌어진 일 때문에 세션 14에서의 기본 행동이 세션 1이랑 눈에 띄게 달라진 경우 말이야. 중간에 사람이 개입해서 프롬프트 수정하는 거 없이 말이지.
만약 없다고 하면 그것대로 흥미로운 거고, 만약 있다면 진짜 그 구조가 어떻게 되어 있는지 너무 궁금함.

