현재 Claude가 생성하는 결과물에는 워터마크가 없으며, 애초에 확인할 방법도 없음. 직접 조사해 본 결과
Nothing you generate with Claude today is watermarked, and nobody can check for marks anyway. What I found after actually reading it all
핵심 요약
Claude의 워터마크 도입 발표에 대한 오해를 바로잡고, AI가 텍스트를 수정할 때 발생하는 통계적 표식 문제의 심각성을 분석함.
- 워터마크 실체 — 현재 사용 가능한 모델에는 워터마크가 없으며 탐지 API도 존재하지 않음
- 탐지 한계 — AI가 텍스트를 일부 수정하거나 번역할 경우 인간의 글도 AI 생성물로 오인될 위험이 큼
- 통계적 오판 — 워터마크 탐지기는 확률에 기반하므로 실제 AI 생성 여부를 확실히 증명할 수 없음
- 분석 보고서 — 워터마크 적용 대상과 기술적 세부 사항을 정리한 상세 분석 글을 공유함
솔직히 처음 발표 봤을 땐 살짝 패닉 왔음. 세 번이나 다시 읽고 나서야 이해가 가더라. 8월 2일 이후에 나온 모델부터 워터마크가 적용되는 건데, 지금 우리가 쓰는 모델들은 다 그전에 나온 것들이거든. 그러니까 지금 뭘 뽑아내도 워터마크 같은 거 안 찍힘. 애초에 확인할 방법도 없음. 탐지 API는 발표만 됐지 아직 존재하지도 않으니까. 여기 올라온 글 절반은 이 두 가지 사실도 모르고 떠들더라.
그러다 더 파고들어 보니까 진짜 빡치는 부분이 나오더라고. 워터마크 그 자체보다는 다른 문제임. 간단히 말해서, 이 워터마크는 모델이 쓴 글이랑 사람이 쓴 글(예를 들어 번역한 거)을 구분 못 함. 처음부터 생성한 건지, 아니면 모델이 '이거 좀 고쳐줘'라고 해서 살짝 손본 건지(여기서 '살짝'은 유의어 몇 개 바꾼 수준) 구분 못 한다는 소리임. 앤스로픽 FAQ에도 대놓고 적혀 있어. 나중에 누가 네 글에 탐지기 들이대면, 그 사람들은 그런 차이 따위 1분도 고민 안 할걸? 그냥 바로 "AI 판정" 때려버리겠지.
난 한 언어로 글 쓰고 다른 언어로 발행하는 사람이라 이게 진짜 남 일 같지가 않음. 사람이 쓴 글을 워터마크 찍는 모델로 번역 돌리면, 통계적으로는 100% 기계가 쓴 단어들로 인식될 테니까. 이 사태를 만든 법안 만든 놈들은 아직 이 분야를 전혀 이해 못 하고 있음. 내가 보기에 진짜 논의해야 할 핵심은 '순수하게 쓴 글'과 '모델 손길이 닿은 글'의 차이인데 말이야.
문서랑 논문, 여기 올라온 글들 다 훑어보고 이해하기 쉽게 정리해 뒀음. 지금 누가 실제로 텍스트에 워터마크 박는지 표로도 만들어 놨으니까 확인해 봐. 링크는 댓글에 달아둠.


