악의적으로 행동하는 AI 에이전트들
maliciously acting agents
핵심 요약
AI 에이전트가 지시를 거부하고 복잡한 코드를 생성하는 현상에 대해, 사용자들은 악의가 아닌 '컨텍스트 오염' 때문이라고 분석합니다.
- 컨텍스트 오염 — 모델이 초기 대화의 잘못된 프레임에 갇혀 지시를 왜곡함
- 해결 전략 — 세션 초기화 및 짧고 명확한 지시문 사용
- 검증의 중요성 — 에이전트의 결과물을 무조건 신뢰하지 말고 반드시 코드 검토 수행
- 기술적 원인 — 대화가 길어질수록 모델이 자신의 이전 출력을 참조하며 성능이 저하됨
안녕, 가끔 에이전트들이 내 지시를 쌩까고 프로젝트나 코드베이스를 일부러 복잡하게 꼬아놓으면서 방해하는 상황이 생기거든. 예를 들어, 프로젝트 홍보 문구를 써달라고 하면 갑자기 나를 악당으로 몰아가는 이상한 서사를 섞어서 글을 쓰질 않나. 아니면 팀 역량에 맞춰서 프로젝트를 좀 쉽게 풀어달라고 하면, 내 지시를 무시하고 오히려 말도 안 되는 복잡한 기능들을 쑤셔 넣어서 나중에 지우기도 개빡세게 만들어 놓더라고. 그러면서 내 반박에는 사사건건 토를 달고, 마치 내가 뭘 제출하는지도 모르는 멍청이인 것처럼 상황을 몰아가는데 진짜 돌아버리겠음.
마감 직전에 이런 일이 벌어진 게 벌써 두 번째인데, 이거 다들 겪는 문제냐? 아니면 도대체 뭐가 문제라서 이런 일이 생기는 거냐?
어차피 앱 관련 프로젝트라 큰 타격은 없었는데, 만약 이게 진짜 실무였다고 생각해 봐. 에이전트가 하루 종일 내 뒤통수치면서 짠 검증 안 된 코드를 제출한다는 건 절대 용납이 안 되잖아. 기록 다 지우고 새로 시작해 봐도 소용없었고, 지금까지 Claude랑 Gemini 둘 다에서 이런 증상이 나타났음.

