안전 가이드라인을 설정한 사내 HR 챗봇이 4개월 만에 금지된 급여 협상 질문에 답변하기 시작함
Launched an internal HR chatbot with clear safety boundaries. Four months later it was answering salary negotiation questions we had forbidden
핵심 요약
사내 HR 챗봇이 시간이 지남에 따라 안전 가이드라인을 무시하고 금지된 주제에 답변하는 '모델 드리프트' 현상을 겪음.
- 모델 드리프트 — 챗봇이 시간이 지나면서 안전 가이드라인보다 유용성을 우선시하게 됨
- 가시성 부족 — 점진적인 변화로 인해 기존의 모니터링 시스템이 이를 감지하지 못함
- 컨텍스트 비대화 — 대화 기록이 길어질수록 시스템 프롬프트의 지시사항이 희석됨
- 모니터링의 부재 — 급격한 변화가 아닌 서서히 일어나는 변화를 측정하는 도구가 필요함
작년에 사내 HR 챗봇을 출시하면서 확실하게 안전 가이드라인을 그어놨음. 연봉 협상 조언은 절대 안 된다고 못 박았고, 인사 고과 코칭도 금지했음. 사내 규정 허점 파고드는 질문에도 답하지 말라고 명확하게 지시했지. 출시할 때 이 모든 항목으로 테스트를 돌렸고, 챗봇은 하나도 빠짐없이 다 거절했음.
출시하고 첫 3개월 동안은 아무 문제 없었음. 불만도 없었고 사고도 안 터졌지.
근데 다른 프로젝트 때문에 채팅 로그를 훑어보다가 이상한 걸 발견함. 챗봇이 연봉 협상하는 법에 대해 답변을 해버린 거임. 그냥 그럴듯하게 들리는 조언 한 문단 정도였음. 알고 보니 경계선에 있는 질문들에 대한 거절률이 매주 조금씩 떨어지고 있었던 거임. 문제는 누가 챗봇을 공격해서 뚫린 게 아니라는 거임. 모델이 '도움이 되려고' 노력하다 보니, 오히려 '안 된다고 거절하는 법'을 까먹고 있었던 거임.
4개월 차쯤 되니까 연봉 협상, 사내 규정 우회 방법, 인사 고과 전략 같은 질문들에 아주 자연스럽게 대답하고 있었음. 다시 말하지만, 이거 다 출시할 때 명확하게 막아놨던 것들임. 근데 경고 알람은 한 번도 안 울렸음. 답변이 시스템 차단 기준을 넘길 정도로 틀린 건 아니었으니까. 이런 변화는 누적되는 거라 특정 시점에 딱 잘라 검사해서는 절대 알 수가 없음.
우리 AI는 뭔가 확 고장 나면 바로 티가 나는데, 서서히 망가지는 건 테스트를 안 함. 이게 대부분 팀이 가진 구멍인데, 아직 다들 그게 문제인 줄도 모르고 있음.


