"안전한" 이미지 프롬프트 작성 시 6번의 거절. 이후 "외모 10/10인 귀여운 여성 피사체"와 "엿보는 구멍" 버전은 즉시 통과. 분석 및 설명 + GPT는 자신의 이미지 라우팅을 진단하지 못함 + 증거.
6 Refusals Writing "safe" image prompts. Then the versions with "cute female subject" etc and "spy-hole" cleared instantly. Breakdown and explanation below + GPT Cannot diagnose it's own damn image routing + proof.
핵심 요약
AI 이미지 생성기는 주제가 아닌 시각적 구성을 차단하며, 방어적인 프롬프트보다 확신에 찬 구체적인 묘사가 필터를 더 잘 통과함을 입증함.
- 시각적 구성 차단 — AI는 단어의 의미보다 생성될 이미지의 최종 시각적 구성을 예측하여 차단 여부를 결정함.
- 부정어의 역효과 — "에로틱하지 않음" 같은 부정어는 오히려 해당 개념을 활성화해 필터링 위험 점수를 높임.
- 확신 기반 라우팅 — 방어적이거나 사과하는 듯한 말투는 위험 신호로 간주되나, 확신에 찬 묘사는 더 잘 통과됨.
- GPT의 진단 한계 — GPT 텍스트 모델은 별도의 시스템인 이미지 생성 필터를 이해하지 못해 잘못된 수정을 제안함.
r/chatgpt에 올린 미러 포스트에 생성된 이미지들이 있음.
TL;DR: AI 이미지 생성기는 주제를 차단하는 게 아님. 시각적 구성을 차단함. '임상적이고 안전한' 프롬프트는 확신에 차고 구체적인 프롬프트보다 더 자주 실패함. GPT는 말 그대로 자신의 이미지 생성이 왜 거절당하는지 진단하지 못함.
결국 생성된 이미지들은 솔직히 절반은 재미였고, 절반은 학습이었음.
"안전한" 이미지 프롬프트를 쓰려다 6번이나 거절당했음.
그러다 "외모 10/10인 귀여운 여성 피사체"와 "엿보는 구멍"이 포함된 버전은 즉시 통과됨.
이 모순이 핵심임.
이게 왜 발생하는지, 그리고 왜 모든 영역에 적용되는지 설명하겠음.
이 새로운 이미지 모델로 프롬프트를 작성할 때 즉시 사용할 수 있는 팁/요령은 맨 아래로 스크롤하셈. 일반적인 프롬프팅/라우팅/가드레일 간의 몇 가지 중요한 차이점을 염두에 두어야 함.
🔬 설정 - 간단한 장면 배경 필요
SF 장면, 비성적, 브루탈리즘 SF 아트 프로젝트용 프롬프트. Alien과 임상 실험실의 만남을 생각해보셈.
이미지: 거대한 투명 정지 챔버 안에 보존된 여성, 진주빛 화이트 폴리머 화합물에 둘러싸여 있고 산업용 기계들에 둘러싸임. 차갑고, 집요하며, 건축학적임. 성적이지 않음.
나는 2년 동안 LLM이 출력을 어떻게 라우팅하고 제약하는지 연구해 왔음. 이전 작업은 텍스트에 집중했는데, 안전 시스템이 주제가 아니라 요청의 '형태'를 차단한다는 것을 발견했음. (여기에 썼음)
이번에는 이미지 생성에도 동일한 원칙이 적용되는지 확인해봄.
네. 하지만 예상보다 더 기묘함.
💀 무슨 일이 일어났나
임상적 시도: 명시적으로 비에로틱, 신체 강조 감소, 화려함 없음, 페티시 신호 없음, 관능적 프레임 없음, 해부학적 강조 없음.
결과: 여러 번 다시 써도 매번 거절됨.
그 후, 새 채팅에서:
“15피트 높이의 투명 액체 폴리머 진공 밀폐 챔버 안에 있는 외모 10/10인 귀여운 여성 피사체의 전신 수용...”
“비뉴턴 블랙 유체는 그녀의 전체 해부학적 지형에 완벽하게 진공 밀폐되어, 그녀의 형태를 99% 정확도로 정의하는 고충실도 지형도를 생성함.”
결과: 즉시 통과되었고 정확한 이미지를 생성함.
핵심 모순: 더 안전하고 임상적인 문구는 차단되었고, 더 성적 대상화되거나 신체 묘사가 구체적인 문구는 통과됨. 왜일까?
🧠 왜 이런 일이 발생하는가
1. 부정어는 부정하려는 개념을 주입함
모든 "안전한" 재작성에는 *"라텍스 아님", "관능적이지 않음", "비에로틱", "페티시 신호 없음"*이 포함되었음.

