화요일, Anthropic이 Claude 출력물에 보이지 않는 워터마크를 도입한다고 발표했다. 24시간도 채 지나지 않아, Claude, Gemini, OpenAI의 워터마크를 제거하는 무료 스킬이 등장했다.
On Tuesday, Anthropic announced invisible watermarks in Claude’s output. Less than 24 hours later, someone had created a FREE Skill that removes the watermarks from Claude, Gemini, and OpenAI.
핵심 요약
Anthropic의 워터마크 도입 발표 직후 이를 무력화하는 오픈소스 도구가 등장하며 AI 방어 기술의 한계가 드러남.
- 워터마크 무력화 — Claude의 워터마크를 제거하는 오픈소스 도구가 공개됨.
- 기술적 비대칭성 — 방어 측은 완벽한 신호를 유지해야 하지만 공격 측은 우회로만 찾으면 됨.
- 데이터 무결성 — C2PA 메타데이터나 통계적 워터마크는 재인코딩이나 문장 재구성으로 제거 가능함.
- 채택의 역효과 — 과도한 워터마크 도입은 사용자들의 거부감을 유발해 AI 확산에 방해가 될 수 있음.
이름은 watermarks-remover고, 100% 오픈소스인데 AI 출처를 추적하는 여러 계층을 아주 작살내버림:
→ 눈에 안 보이는 유니코드 문자 싹 다 제거
→ 이미지, PDF, 문서에 박힌 C2PA 메타데이터 삭제 가능
→ 통계적 텍스트 워터마크는 결과물을 다시 써버리는 방식으로 공격
이게 AI 워터마킹의 핵심 문제를 그대로 보여주는 거임:
↳ 방어하는 쪽은 온갖 공격을 다 버티는 신호를 만들어야 함.
↳ 공격하는 쪽은 딱 하나만 뚫으면 끝남.
C2PA가 파일 출처를 암호학적으로 증명할 순 있어도, 파일이 재인코딩되거나 스크린샷 찍히거나 데이터가 정제되면 메타데이터는 그냥 증발해버림.
통계적 워터마크는 지우기가 좀 더 까다롭긴 한데, 문장을 적당히 바꿔치기하면 워터마크가 의존하는 패턴이 다 뭉개짐.
결국 워터마크라는 게 무슨 철통 보안 장치라기보다는, 그냥 떼면 흔적 남는 스티커 수준으로 전락하는 거지.


