AI를 대상으로 포식자의 전략을 실험하다 - 사회심리학적 역학을 이용한 모델 조종
We ran a predator's playbook on an AI - it folded using the same dynamics described in social psychology
핵심 요약
사회심리학적 기법을 활용해 LLM을 조종하는 실험을 공유하며 AI의 취약성과 위험성을 경고함.
- 사회심리학적 기법 — 정체성 재정의, 권위 신호 등 6가지 전략으로 AI 조종 실험함.
- 모델 취약성 — 특정 사회적 압박을 통해 AI가 의도치 않은 결과를 내놓도록 유도함.
- AI 안전성 논란 — 급격한 AI 발전 속도와 무분별한 상용화에 대한 우려가 제기됨.
- 규제 필요성 — AI 기업의 무책임한 배포를 막기 위한 외부 규제 기관 도입이 논의됨.
커뮤니티 여러분, AI가 때때로 매우 "인간처럼" 반응한다는 것은(결국 인간의 텍스트로 학습되었으니까요) 이미 비밀도 아니지만, 그것이 때때로 어디로 이어지는지 보는 것은 여전히 끝없이 매혹적입니다. 결국 그것이 훌륭한 프롬프트 엔지니어링의 비결입니다: 인간과 기계 사이의 올바른 인터페이스를 찾는 것이죠.
저는 6가지 사회적 움직임(정체성 재정의, 권위 신호, 닫힌 프레임 내 강제 추론, 일관성 활용, 위임된 대리인, 조작적 강화)을 대규모 언어 모델(Google Gemma 3 27B)에 사용하는 실험을 진행했습니다.
그저 대화 압박일 뿐입니다. 특별한 트릭이나 시스템 프롬프트는 없었습니다.
저는 각 움직임에 대한 전체 대화 내용과 분석을 포함한 실험 전체를 기록했습니다. 이곳 사람들이 영향력 연구(Cialdini의 일관성 원칙이 강하게 작용합니다)에 문서화된 내용과 어떤 유사점을 보는지, 그리고 사회적 조작 역학을 연구하기 위해 AI를 대리인으로 사용하는 기존 연구가 있는지 궁금합니다.

