ChatGPT, 이제 EU에서 텍스트 워터마크 적용. '다른 모델로 다시 쓰면 된다'는 방법이 실패하는 3가지 이유와 측정 결과
ChatGPT now watermarks text in the EU. "Just have another model rewrite it" fails in three ways, and I measured each
핵심 요약
AI 텍스트 워터마크를 우회하려는 시도가 왜 불완전하고 위험한지, 모델별 워터마크 잔류와 정보 왜곡 문제를 분석한 글입니다.
- 워터마크 우회 한계 — 다른 모델로 재작성해도 새로운 워터마크가 추가되거나 원본의 정보가 왜곡됨
- 정보 손실 위험 — 재작성 과정에서 미세한 단어 변화가 논문이나 계약서의 핵심 의미를 바꿀 수 있음
- 통제권 불균형 — 사용자는 보이지 않는 워터마크를 확인하거나 제어할 수 없어 불투명한 평가에 노출됨
- 검증 도구 제공 — 워터마크 잔류 여부와 정보 왜곡을 확인할 수 있는 오픈소스 비교 도구 공유
OpenAI가 이번 주에 ChatGPT가 EU 거주 사용자를 대상으로 생성한 텍스트에 워터마크를 넣기 시작했다고 밝혔어. Claude는 이미 8월부터 전 세계적으로 이 짓을 하고 있었고, Gemini 앱은 2024년부터 해왔지. 근데 정작 탐지기는 공개된 게 하나도 없어서 진짜 짜증 나 죽겠어. 이 주제로 글 올라올 때마다 "그냥 다른 모델로 다시 쓰게 하면 됨"이라는 댓글이 꼭 달리길래, 그게 실제로 효과가 있는지 궁금해서 직접 테스트해 봤어. 내 모국어는 영어가 아니고, 내가 공개적으로 쓰는 글 대부분이 모델을 거쳐서 나오니까 이 문제는 나한테도 남 일 같지가 않거든.
첫 번째 문제는 다시 쓰기를 시킨 모델이 텍스트에 또 워터마크를 박아버릴 수 있다는 거야. Claude한테 시키면 기존 워터마크를 Claude만의 워터마크로 바꿔치기할 뿐이지. Claude는 앱이든 API든 모델 수준에서 워터마크를 박아버리니까. Gemini 앱도 마찬가지로 워터마크를 추가하고. 현재 알려진 워터마크가 없는 모델은 중국 쪽 모델들인 DeepSeek, GLM, Qwen, 그리고 네가 직접 돌리는 모델들뿐이야.
두 번째 문제는 모델한테 "이거 다시 써줘"라고 시키면 생각보다 바뀐 게 별로 없다는 거야. 8월에 6개 모델 시스템에 똑같은 문서 6개를 주고 똑같이 단순한 지시를 내려봤는데, 단어 변경률이 40%에서 73% 사이였어. OpenRouter에서 쓸 수 있는 무료 모델들로 돌려보니까 더 가관이더라. 하나는 텍스트의 2%만 바꿨고, 추론 기능을 끈 무료 Qwen 모델은 3분의 1만 바꿨어. 감을 잡기 쉽게 말해주자면, OpenAI 공식 글에 따르면 단어의 4분의 1을 유의어로 바꾸면 탐지율이 92%에서 17%로 떨어지지만, 10%만 바꾸면 66%까지밖에 안 떨어진대. 단어 3분의 1을 바꾸는 건 별로 효과가 없다는 소리지.
세 번째 문제는 나한테 제일 중요한 건데, 바로 '팩트 왜곡'이야. 조용히 팩트를 날려 먹는다는 거지. 서로 다른 벤더의 모델 4개를 심사위원으로 세워서, 어떤 모델이 쓴 건지 모르는 상태로 다시 쓴 글들의 의미 오류를 검사해 봤어. MiniMax는 문서 6개 전체에서 오류가 딱 하나였고 단어는 40% 바꿨는데, Qwen3.7 Plus는 단어를 73%나 바꾸면서 문서당 오류를 거의 3개씩 냈어. 작은 Qwen 모델은 오류가 4개나 됐고. 역번역(독일어로 번역했다가 다시 영어로)도 해봤는데 같은 모델로 그냥 다시 쓰는 것보다 결과가 더 구렸고, 중국어를 거치면 더 최악이었어. 문서당 오류가 4개가 넘더라. 내 리라이터가 쓴 글 6개를 읽어본 검토자가 "should"가 "must"로 바뀌고 "17.5%를 포함한다"가 "최대 17.5%까지 포함한다"로 바뀐 걸 찾아냈어. 논문이나 계약서에서는 이런 작은 단어 하나가 엄청난 결과를 초래하잖아. AI가 의역한 건 무조건 네가 직접 다시 읽어봐야 해.
그러니까 이 방식을 쓰려면,
-
워터마크가 없는 모델을 고르고,
-
텍스트를 개선하라고 하지 말고 문장 하나하나를 새로 짜라고 시키고 (허접한 무료 모델들은 이것조차 제대로 안 함),
-
용어, 이름, 숫자는 그대로 유지하라고 지시해.
-
그러고 나서 두 가지를 확인해. 단어가 실제로 얼마나 바뀌었는지, 그리고 팩트가 제대로 살아있는지.
더 쉬운 확인을 위해 내가 완전히 무료인 오픈소스 비교 툴을 만들었어. 5단어 시퀀스가 얼마나 바뀌었는지(내 연구에 따르면 워터마크가 살아있는지 확인하는 좋은 지표야), 어떤 팩트가 빠졌는지, 어떤 시퀀스가 안 바뀌었는지 보여주는 툴이야. 실제 탐지기는 비공개니까 이게 네가 쓸 수 있는 유일한 측정 수단이지. 툴이랑 모든 표가 포함된 전체 리포트 링크는 댓글에 달아둘게. 내가 쓰는 오픈소스 리라이터 링크도 거기 있으니까 네 API 키랑 무료 모델 연결해서 써봐.

