Claude 5.1에 워터마크가 도입되었습니다. 공개된 탐지기는 없는데, 저는 우회 방법을 만들고 있습니다. 여러분은 어떻게 생각하시나요?
Fable 5.1 is now watermarks anything you write with it. There is still no public detector. This pisses me off, so I'm making a workaround. How about you?
핵심 요약
Claude 5.1의 텍스트 워터마크 도입에 반발하여, 작성자가 이를 우회하는 연구와 도구를 공유하며 논의를 제안했습니다.
- 워터마크 도입 — Claude 5.1 생성 텍스트에 통계적 워터마크가 포함됨
- 탐지기 부재 — 일반 사용자는 자신의 텍스트를 검증할 도구가 없음
- 우회 연구 — 작성자가 워터마크 제거 실험 및 도구 개발을 진행함
- 기술적 난제 — 단순 재작성으로는 워터마크 신호가 완전히 제거되지 않음
3주 전에 여기다 Claude로 생성한 건 아직 워터마크 안 박힌다고 글 썼는데, 이제는 틀린 말이 됐네. Fable 5.1부터는 번역을 포함해서 생성된 텍스트에 통계적 워터마크를 박아버린다. 특히 번역할 때가 웃긴데, 다른 LLM으로 역번역(심지어 중국어로 해도!)을 돌려도 SynthID 워터마크가 안 지워지거든. 근데 Claude로 번역만 돌리면 바로 워터마크가 생겨.
이런 워터마크를 잡아내는 탐지기는 출시한다고 해놓고, 최근에야 일부 선정된 기관들한테만 비공개 프리뷰로 풀렸어. 나 같은 일반 유저는 여전히 내 글을 검사할 공개 도구나 API가 하나도 없어. 그러니까 나는 나중에 권한 있는 사람이 검사할 수 있는 글을 오늘 올리는 셈인데, 정작 나는 올리기 전에 똑같은 검사를 해볼 수가 없는 거지.
난 평소에 한 언어로 글을 쓰고 다른 언어로 발행해. 내가 직접 글을 쓰고 Claude한테 번역을 시키면 워터마크가 박힌 영어 버전이 나오겠지. 이 워터마크는 Claude가 문장 다듬는 데 관여했다는 걸 나타낼 뿐이야. 누가 논리를 짰는지, 누가 조사를 했는지는 아무것도 말해주지 않는데, 결과물에 대한 평가는 부당하게 왜곡될 수밖에 없지.
사람들이 왜 이걸 싫어하는지 이해가 가. 남이 내 글을 보고 멋대로 판단하기 전에, 내 글이 검사에서 어떻게 나올지 내가 먼저 알고 싶거든. 기관들이 이 탐지기를 어떻게 써먹을지도 모르겠고. 그리고 다시 말하지만, AI가 생성한 건지 아니면 단순히 AI로 편집(구조를 바꾼다거나)한 건지 구분하는 건 불가능해. 학생, 과학자, SEO 전문가, 그리고 영어권 아닌 사람들은 지금 진짜 빡쳐있을걸.
이런 답답함 때문에 Claude 워터마크의 기반이 된 Google DeepMind의 SynthID 워터마킹 방식을 직접 실험해 봤어. 내 테스트 키로 재현해 보니까, 내용을 완전히 다시 쓰면 테스트 샘플에서 마크가 지워지긴 하더라(대신 팩트 오류가 좀 생김). 역번역으로는 워터마크가 안 지워지고, 전문적인 방법들은 여전히 너무 무겁고 완벽이랑은 거리가 멀어. 그래서 결국 나 혼자 쓰려고 워터마크 제거기를 만들어서 무료 데모로 공유하기로 했어(실제 탐지기가 나오기 전까진 이게 최선이니까). 실험 내용이랑 오픈 소스 설정, 그리고 트레이드오프랑 팩트 교정 방법도 다 적어놨어. 링크는 댓글에 달게.
너희도 AI 결과물에 보이지 않는 마크 박는 거 미친 짓이고 불공평하다고 생각하냐? 아니면 왜 사람들이 이렇게 화내는지 이해가 안 가?
PS. 이 테스트들이 Anthropic이나 Google의 실제 프로덕션 워터마크를 완벽하게 제거한다고 보장하는 건 아냐. 그래도 지금 상황에선 보장 없어도 할 수 있는 건 다 해보는 게 낫다고 봐.
PPS. 댓글 보니까 Qwen이나 다른 모델한테 다시 쓰라고 시키면 워터마크 없어진다고 생각하는 애들이 있는데, 그거 틀렸어. 내가 테스트해 봤는데 신호가 상당 부분 그대로 남아있어. 여러 번 반복해서 돌려야 하고, 문장 바꾼 뒤에도 안 바뀐 5단어(사실 5-gram) 시퀀스를 일일이 찾아서 LLM한테 지적해주고, 팩트 체크해서 수정까지 해야 해. 안 그러면 워터마크 신호는 그대로 남고 팩트 오류만 새로 생길 뿐이야.
PPPS. 댓글에서 내가 이 주제를 다룰 만큼 전문 지식이 없다고 까는 애들이 있는데, 나 디지털 신호 처리(Digital Signal Processing) 박사야. 워터마킹은 내 전공 분야라고.
UPD. 댓글에서 링크 찾기 힘들다는 말이 많아서 여기다 바로 적어둘게.
전체 글 & 연구: painintheagent.com/blog/text-watermark-removal-retest/
코드, 코퍼스, 프롬프트, 모델 출력물 및 판정 결과:
워터마크 제거기 (텍스트 붙여넣으면 바뀐 부분 강조해서 다시 써줌):


