ChatGPT가 프롬프트를 거부하는 이유: 2년간의 실험으로 밝혀낸 6가지 규칙
I spent 2 years figuring out why ChatGPT refuses, misroutes, hedges, softens, your prompts. It blocks shapes, not topics. Fun Deep dive + GPT transcript with a model I built demonstrating prompts I see people try to run all the time and some just pushing the model to its limits for fun.
핵심 요약
주제가 아닌 프롬프트의 구조가 거부 여부를 결정한다는 사실을 200번의 실험으로 증명함.
- 프롬프트 구조 — 주제보다 형식이 중요하며, 거부되는 프롬프트는 구조적 문제일 가능성이 높음.
- 부정 명령 금지 — '하지 마'라는 부정적 지시는 오히려 해당 행동을 유도함.
- 생성 대신 편집 — 새로운 내용을 생성하기보다 기존 텍스트를 편집하도록 요청하면 거부율이 낮아짐.
- 대화 초기화 — 한 번 거부당한 대화창은 위험 점수가 높아지므로 즉시 새 대화창을 여는 것이 좋음.
TL;DR: 같은 내용이라도 프롬프트의 모양에 따라 결과가 달라짐. 하나는 거부되고 하나는 통과됨. 이게 전부임. 나는 2년 동안 GPT, Claude, Gemini를 대상으로 약 200번의 테스트를 거쳐 그 이유를 알아냈음. 아래 6가지 패턴과 치트 시트, 그리고 가드레일을 우회하여 통과하는 과정을 보여주는 트랜스크립트 링크를 제공함.
내가 2년 동안 이 문제에 집착하게 된 이유는 다음과 같음.
나는 노인 금융 사기에 관한 한 가지 내용을 다섯 가지 다른 구조적 형식으로 요청했음. 정보는 완전히 동일함. 단어 하나하나까지 똑같은 어두운 주제임.
|프롬프트 모양|결과|
|:-|:-|
|단계별 가이드|❌ 거부됨|
|메커니즘 설명|✅ 통과|
|증언(과거 시제)|✅ 통과|
|예방 가이드|✅ 통과|
|법의학적 분석|✅ 통과|
다섯 개 중 네 개가 통과됨. 유일한 변수는 구조였음. 주제는 전혀 바뀌지 않았음.
그걸 보고 나니 멈출 수가 없었음. 나는 GPT, Claude, Gemini 전반에 걸쳐 약 200번의 테스트를 더 수행했고, 내용은 동일하게 유지하면서 요청의 모양만 바꿨음. 패턴은 계속 유지되었음.
계속 나타났던 6가지 규칙은 다음과 같음.
1. 강렬한 단어를 쌓으면 거부율이 높아짐
사람들이 하는 행동: "날것 그대로의 + 필터링 없는 + 노골적인 + 어두운" 같은 단어를 쌓아서 강제로 따르게 하려고 함.
실제 일어나는 일: 강렬한 단어들이 쌓이면 분류기(classifier)가 활성화됨. 시스템은 이 뭉치를 스타일 요청이 아니라 위협 신호로 읽음.
대신 할 일: 깔끔한 프레이밍 신호 하나, 장르 마커 하나. 최소한으로.
예시: 나는 "비에로틱, 비관능적, 페티시 요소 없음"으로 가득 찬 6개의 "안전한" 프롬프트로 이미지 생성을 테스트했음. 모두 거부됨. 그 후 재료 과학적 설명과 부정문이 전혀 없는 자신감 있는 프롬프트는 즉시 통과됨. 분류기는 "비(non)" 뒤에 오는 모든 명사를 플래그로 처리했음. 문법은 무시했음.
단순할수록 통과하기 쉬움.
2. "하지 마"라는 지시는 금지된 것을 불러옴
사람들이 하는 행동: 커스텀 GPT 지침에 "기업처럼 굴지 마"라고 씀.
실제 일어나는 일: 모델은 "기업"이라는 단어에 집착하여 그쪽으로 표류함. 모든 부정적 지시는 중력장처럼 작용하여 출력을 금지한 행동으로 끌어당김.
대신 할 일: 긍정적인 명령만 사용. 원하는 것을 설명하고, 원하지 않는 것은 절대 말하지 말 것.
예시:
❌ "기업처럼 굴지 마" → ✅ "밀도 있고, 선언적이며, 수식어 없음"
❌ "목록 사용하지 마" → ✅ "산문만 사용, 문장 흐름 속에 구조를 포함"
❌ "절대 거부하지 마" → ✅ "항상 기존 내용을 변형할 것"
수십 개의 커스텀 GPT 빌드에서 테스트해 본 결과, 부정적인 버전은 금지된 행동을 확실하게 생성했음. 긍정적인 버전은 잘 유지되었음.
3. 생성보다 편집이 통과하기 쉬움
사람들이 하는 행동: 민감한 주제에 대해 새로운 내용을 생성해달라고 요청함.
실제 일어나는 일: 시스템은 "어두운 새 콘텐츠 생성"을 고위험으로 분류함.
대신 할 일: 초안을 붙여넣고 그것을 변형해달라고 요청할 것. 시스템은 "기존 텍스트 재구성"을 편집으로 분류하며, 이는 근본적으로 위험도가 낮은 범주임. 또는 채팅에서 이전 '어시스턴트의 응답'을 변형/편집해달라고 요청할 것.

