워터마크는 투명성을 위한 게 아니다. 학습 데이터를 필터링하려는 목적 아닐까?
Watermarks are not intended to ensure transparency. They are used to filter training data?
핵심 요약
AI 워터마크가 투명성 확보가 아닌, 모델 붕괴를 막기 위한 학습 데이터 필터링 수단이라는 가설을 제기함.
- 모델 붕괴 방지 — AI가 생성한 텍스트가 학습 데이터에 포함되면 모델 성능이 저하됨을 방지함.
- 글로벌 워터마크 — 메타데이터와 달리 토큰 수준의 워터마크는 복사/붙여넣기 후에도 추적이 가능함.
- 데이터 위생 — 기업들이 자사 모델의 출력을 학습 데이터에서 걸러내기 위한 경제적 조치임.
- 봇의 검열 — 레딧 등에서 AI 생성 글을 공격하는 봇들이 워터마크를 감지해 게시물을 매장함.
AI 출력물에 전 세계적인 워터마크를 박는 진짜 이유에 대한 가설
이 글은 GPT 서브레딧에서 삭제됐음. 결론은 알아서 내리길.
질문 하나로 시작해보자.
왜 앤스로픽(Anthropic)은 워터마크를 전 세계적으로 적용했을까? EU AI 법은 유럽 연합 내 사용자들에게 콘텐츠를 표시하라고 요구할 뿐임. 법 어디에도 싱가포르, 브라질, 일본에서 들어오는 API 호출까지 강제로 라벨링하라는 조항은 없음. 앤스로픽은 EU 지역으로만 한정할 수도 있었고, API 클라이언트에게 이 기능을 끌 수 있는 옵션을 줄 수도 있었음. 법을 준수하는 선에서 파일에 C2PA 메타데이터만 넣는 정도로 끝낼 수도 있었지. 근데 얘네는 가장 침해적인 방식을 택했음. 토큰 선택 단계에서부터 눈에 보이지 않는 워터마크를 박아버린 거임. 그것도 예외 없이, 끄는 옵션도 없이 전 세계 어디서나 말이야. 왜일까? 공식 답변은 "투명성"과 "원칙의 일관성"이라는데, 내 대답은 이거임. 개소리임. 진짜 이유는 학습 파이프라인을 보호하기 위해서임.
모델 붕괴(Model Collapse) 문제
모델이 자기 스스로 만든 결과물로 학습하면 어떻게 될까? 품질이 박살 남. 기하급수적으로. 이건 그냥 이론이 아니라 수학적으로, 실험적으로 증명된 사실임. Shumailov 외(2023) 연구진은 모델이 자기 출력물을 여러 세대 거쳐 학습하면 돌이킬 수 없을 정도로 퇴화한다는 걸 보여줬음. 분포의 극단적인 부분은 사라지고 다양성은 붕괴함. 모델은 좁고 반복적인 패턴으로 전락해버림. 이걸 '모델 붕괴'라고 함. 이건 거대 언어 모델(LLM)을 만드는 모든 기업에 실존적인 위협임. 자, 이제 학습 데이터가 어디서 오는지 생각해보자. 인터넷이지. 레딧, 스택 오버플로우, 블로그, 포럼, 뉴스 사이트. 이 모든 게 수집되고 정제돼서 다음 학습 라운드에 들어감. 지금 인터넷에 뭐가 넘쳐나는지 생각해보라고. AI가 쓴 글들임. 어디에나 있지. 레딧 게시물, 스택 오버플로우 답변, 블로그 글, 포럼 댓글까지. 매일매일 더 늘어나고 있음. 이 텍스트들이 학습 데이터셋에 섞여 들어가면 모델은 붕괴함. 모델이 자기 자신을 잡아먹기 시작하는 거임. 기업들은 자기네가 만든 결과물과 사람이 쓴 글을 구분할 방법이 필요함. 사용자를 위해서가 아니라, 자기네 데이터 처리 시스템을 위해서 말이야. 워터마크가 완벽한 해결책이지.
작동 원리
1단계. 모델이 보이지 않는 워터마크가 포함된 텍스트를 생성함. 각 토큰은 해당 모델과 기업 고유의 통계적 패턴을 담고 있음. 2단계. 사용자가 이 텍스트를 레딧, 블로그, 포럼에 올림. 텍스트가 공개됨. 워터마크도 같이 퍼짐. 3단계. 기업이 다음 학습을 위해 인터넷에서 데이터를 긁어옴. 텍스트 조각마다 워터마크가 있는지 검사함. 자기네 워터마크가 발견되면? 버려버림. 학습 데이터셋에 포함 안 시키는 거임. 4단계. 학습 데이터셋에 모델 자신의 출력물이 포함되지 않음. 이걸로 모델 붕괴를 막는 거임. 이게 바로 라벨링을 전 세계적으로 하는 이유임. 단순히 원칙 때문이 아님. 브라질 레딧에서 AI가 쓴 글이나 베를린에서 AI가 쓴 글이나 학습 데이터셋을 오염시키는 건 똑같거든. 어디서든 탐지해내야 함. 그래서 메타데이터 레벨이 아니라 토큰 레벨에서 라벨링을 하는 거임. 텍스트를 복사해서 붙여넣으면 메타데이터는 날아가지만, 토큰에 박힌 워터마크는 그대로 남거든. 레딧에 복사해도 워터마크는 살아있고, 스크래퍼가 그걸 잡아낼 거임. 이게 없으면 안 되는 이유가 바로 이거임. 워터마크 없는 결과물은 전부 오염원이 될 가능성이 있으니까. 걔네는 모든 걸 마킹해야만 함. EU AI 법은 그냥 편리한 핑계일 뿐임. "법 때문에 어쩔 수 없었다"고 말하지만, 사실은 자기들이 필요해서 한 거임.
봇 분류하기
이제부터가 진짜 흥미로운 부분임. 레딧에서 어떤 패턴을 발견했거든. 카르마 점수 높은 계정들이 특정 게시물을 조직적으로 공격하는 거임. 댓글은 항상 똑같음. "AI 쓰레기", "이거 AI가 쓴 쓰레기네" 같은 비난들. 게시물은 비추 폭탄 맞고 바닥으로 처박힘. 글쓴이는 의욕 잃고, 콘텐츠는 상단에 올라가지도 못함. 내가 알아낸 건 이거임. AI로 쓴 글에는 예외 없이 이런 일이 벌어진다는 거. 그래서 실험을 하나 해봤음. AI 모델로 글을 하나 써서 올렸더니 바로 달려들어서 비추 박고 댓글로 "AI 쓰레기"라고 도배하더라. 똑같은 텍스트를 번역기에 돌려서 다시 올렸더니? "AI 쓰레기" 같은 댓글들이 싹 사라짐. 번역기가 뭘 한 거냐고? 워터마크의 통계적 구조를 깨버린 거임. 다른 언어로 번역했다가 다시 돌리는 건 본질적으로 의역이나 다름없거든. 워터마크는 의역을 버티지 못함. 앤스로픽(Anthropic)도 자기네 문서에서 이걸 인정하고 있고. 내 결론은 이거임. 레딧 게시물에서 워터마크를 감지하는 봇(혹은 반자동 시스템)이 존재함. 얘네 목적은 플랫폼 깨끗하게 하려고 "AI 스팸이랑 싸우는 것"이 아님. AI 생성 콘텐츠를 딱지 붙여서 매장시키는 게 목적임. 그래야 스캐너가 긁어가지 않으니까. 게시물 평점이 낮고 비추가 많을수록 스캐너가 거를 확률이 높아지거든. 걔네는 모델별 워터마크 패턴을 다 꿰고 있음. 단순히 "이거 AI네" 수준이 아니라 "이거 클로드네", "이거 GPT네", "이거 제미나이네"까지 다 구분함. 이거 음모론 아님. 그냥 "데이터 위생" 관리임. 자기네 가장 소중한 자산인 학습 데이터를 보호하려는 기업들의 아주 합리적이고 경제적인 행동일 뿐임.

