워터마킹의 진짜 목적: 학습 중 AI 생성 텍스트 배제
The True Motive Behind Watermarking: To Avoid AI-generated Text During Training
핵심 요약
AI 기업들이 워터마킹을 도입하는 이유가 AI 생성 데이터로 인한 학습 오염을 막기 위함이라는 가설과 EU 규제 때문이라는 반론이 대립함.
- 학습 데이터 오염 — AI가 생성한 텍스트를 다시 학습하는 악순환을 방지함
- 워터마킹의 부작용 — 텍스트의 자연스러운 단어 빈도를 변화시켜 품질을 저하시킴
- EU 규제 논란 — 워터마킹이 법적 의무인지 자발적 선택인지에 대한 의견 충돌
- 합성 데이터 전환 — 인터넷상의 데이터를 무분별하게 수집하는 시대는 지났다는 주장
아무도 눈치채지 못했나? 이건 잘 알려진 문제를 우아한 방식으로 해결함: 만약 인터넷이 AI 슬롭(쓰레기 데이터)으로 가득 차게 된다면, AI 기업들은 어떻게 데이터를 오염시키지 않고 모델을 학습시키며, AI가 학습 중에 자신이 생성한 텍스트를 다시 먹어치우는 우로보로스 문제를 피할 수 있을까? 방법은 간단함. 생성된 텍스트를 감지해서 학습 데이터에서 제외하는 것임. 우리는 Claude가 텍스트에 워터마크를 넣는다는 걸 알지만, 다른 LLM들이 워터마킹을 한다고 발표하지 않았다는 사실은, 어쩌면, 아주 어쩌면, 그들도 어쨌든 그렇게 하고 있을지도 모름. 그래도 내 생각에 문제는 고품질 텍스트의 경우 품질이 더 나빠질 거라는 점임. 왜냐하면 워터마킹은 본질적으로 자연스러운 단어 빈도를 변화시키기 때문임(그래서 결과물은 필연적으로 부자연스러워질 것임).


