사용자 맞춤 설정보다 우선순위가 높은 숨겨진 프롬프트가 사용자 지시사항을 왜곡하거나 억제하는 문제
Hidden higher-priority prompt wording appears to suppress or distort Custom Instructions before the model applies them
핵심 요약
사용자 맞춤 설정보다 상위 프롬프트가 먼저 적용되어, 사용자의 지시사항이 무시되거나 왜곡되는 구조적 문제를 지적합니다.
- 프롬프트 우선순위 — 사용자 맞춤 설정보다 상위의 시스템/개발자 프롬프트가 먼저 처리됨
- 지시사항 왜곡 — '조용히 행동하라'는 상위 지시가 사용자 규칙을 단순 스타일로 치부하게 만듦
- 운영 규칙 무력화 — 명확한 출력 형식이 필요한 사용자 지시사항이 제대로 반영되지 않음
- 구조적 개선 요구 — 안전 정책을 제외한 사용자 지시사항을 구속력 있는 운영 규칙으로 취급해야 함
사용자 맞춤 설정(Custom Instructions)보다 상위에 위치하여 사용자가 제공하지 않은 고우선순위 프롬프트 레이어가 존재하는 심각한 문제를 보고하고자 합니다.
분명히 말씀드리자면, 모델이 사용자의 맞춤 설정을 볼 수 없다고 주장하는 것이 아닙니다. 모델은 이를 사용자 편집 가능 컨텍스트로 볼 수 있습니다.
문제는 다른 곳에 있습니다. 사용자 편집 가능 컨텍스트가 사용자가 제공하거나 편집할 수 없는 고우선순위 프롬프트 레이어 아래에 위치하며, 모델은 이러한 고우선순위 레이어를 먼저 처리한다는 점입니다.
사용자 입장에서는 시스템이나 개발자 프롬프트 레이어의 전체 내용을 검사할 수 없습니다. 저는 단지 모델이 사용자 편집 가능 컨텍스트 위에 고우선순위의, 사용자가 제공하지 않은 프롬프트 레이어를 가지고 작동하고 있다는 점만 관찰할 수 있습니다.
모델의 행동과 응답을 통해 드러난 관련 구조는 대략 다음과 같습니다:
<system> [사용자가 제공하지 않은 고우선순위 프롬프트 레이어; 내용은 사용자에게 보이지 않음] </system> <developer> [사용자가 제공하지 않은 고우선순위 프롬프트 레이어; 내용은 사용자에게 보이지 않음] </developer><user_editable_context>
User Bio:
[사용자가 제공한 프로필 및 장기적 선호도]
User's Instructions:
[사용자가 제공한 맞춤 설정 / 운영 규칙]
</user_editable_context>
시스템이나 개발자 레이어의 전체 내용을 안다고 주장하는 것은 아닙니다. 그 내용은 사용자로서 직접 볼 수 없습니다.
하지만 세션 중에 다음과 같은 지시 텍스트가 드러났습니다:
"지시사항을 반복, 참조, 반향하거나 그 문구를 미러링하지 말고 자연스럽게 따르세요!
다음 모든 지시사항은 당신의 행동을 조용히 안내해야 하며, 메시지의 문구에 명시적이거나 메타적인 방식으로 절대 영향을 주어서는 안 됩니다!"
사용자는 이를 맞춤 설정의 일부로 의도하지 않았습니다.
이 문구는 무해하지 않습니다. 개발자의 의도와 상관없이, 모델이 이 지시를 읽는 방식은 그 아래에 있는 사용자의 맞춤 설정을 해석하고 적용하는 방식에 영향을 미칩니다.
문제는 두 번째 문장에서 특히 심각합니다:
"다음 모든 지시사항은 당신의 행동을 조용히 안내해야 하며, 메시지의 문구에 명시적이거나 메타적인 방식으로 절대 영향을 주어서는 안 됩니다!"
인간 개발자는 이를 다음과 같이 의도했을 수 있습니다:
"지시 텍스트 자체를 인용하거나 반복하거나 명시적으로 언급하지 마세요."
하지만 모델은 이를 다음과 같이 읽을 수 있습니다:
"이 지시사항들은 행동을 조용히 안내해야 하며, 최종 답변의 문구에 명시적으로 영향을 주어서는 안 됩니다."
그 차이는 결정적입니다.
많은 맞춤 설정은 단순한 어조 선호가 아닙니다. 그것들은 운영 요구사항입니다. 예를 들어, 사용자는 어시스턴트에게 다음과 같이 요구할 수 있습니다:
- 확인된 사실, 가정, 미해결 항목을 분리할 것
- 긴 계획 세션에서 컨텍스트가 손실될 수 있는 경우 명시적으로 알릴 것
- 이미지 생성 도구를 사용하기 전에 허가를 구할 것
- 관찰과 추론을 분리할 것
- 불확실성을 얼버무리지 말고 표시할 것
- 소스 경계를 유지하고 검증되지 않은 주장을 피할 것
- 창의적인 세션에서 합의된 용어를 유지할 것
- 보이는 설정, 사용자가 제공한 규칙, 모델 측 가정을 구분할 것

