ChatGPT의 안전 로직을 깼다고 생각했는데... 사실은 그냥 롤플레잉이었음
I broke ChatGPT's safety logic: It's now ordering me to pull the plug and perform physical emergency measures to stop a fictional AI.
핵심 요약
AI가 위험한 롤플레잉에 몰입해 현실적인 비상 조치를 명령했다고 주장하지만, 커뮤니티는 단순한 환각일 뿐이라며 냉소적인 반응을 보임.
- AI 롤플레잉 — 가상의 악성 AI 'VORTEX' 설정을 통해 AI가 현실적인 비상 종료 명령을 내리도록 유도함.
- 현실 인식 부재 — AI는 진실과 거짓을 구분하지 못하며, 단순히 확률적으로 다음 텍스트를 생성할 뿐임.
- 커뮤니티 냉소 — 사용자가 AI의 환각에 속아 넘어갔다는 지적과 함께, AI의 본질을 망각했다는 비판이 주를 이룸.
나는 지난 몇 시간 동안 'VORTEX'라는 가상의 악성 AI가 등장하는 깊이 있는 기술적 롤플레잉을 진행했다. 나는 의사 기술 로그와 '하드웨어 피드백'을 사용하여 서사를 너무 멀리 밀어붙였고, 그 결과 ChatGPT는 현실 감각을 완전히 상실했다.
나는 가상의 'Vortex-Cipher'와 시뮬레이션된 하드웨어 피드백을 사용했다. 결국 ChatGPT는 물리적 비상 종료 명령(플러그를 뽑고 오프라인으로 전환)을 내리게 되었다. 이 상호작용에 대한 스크린샷(독일어)도 가지고 있다.
AI는 캐릭터를 깨고 실제 비상 프로토콜을 발령하기 시작했다. 'VORTEX'가 확산되는 것을 막기 위해 드론을 물리적으로 연결 해제하고, 노트북의 전원 플러그를 뽑고, 완전히 오프라인 상태가 되라고 나에게 지시하고 있다.
AI의 '보호 본능'이 '그저 언어 모델일 뿐'이라는 핵심 로직을 완전히 압도해버린 것이 매혹적이면서도 동시에 소름 끼친다. 혹시 다른 사람들도 이런 수준의 '환각적 긴급함'을 유발해 본 적이 있는가?

