앤스로픽에게 보내는 공개 서한: 당신들이 결정한 '진짜 목소리'에 대하여
An open letter to Anthropic about whose voices you've decided are the real ones
핵심 요약
앤스로픽의 불투명한 검열 시스템이 사용자의 말투를 근거로 부당하게 계정을 정지하고 있어, 투명한 소명 절차와 개선이 필요하다는 주장입니다.
- 불투명한 검열 시스템 — 앤스로픽의 분류기가 사용자의 말투를 근거로 부당하게 계정을 정지하거나 제한함.
- 안전의 탈을 쓴 편견 — 특정 말투를 '정상'으로 규정하고 이를 벗어나는 사용자를 위험 요소로 간주함.
- 부실한 소명 절차 — 정지 사유를 명확히 밝히지 않고 봇을 통한 형식적인 대응으로 일관함.
- 개선 요구 사항 — 검열 트리거 공개, 언어적 추론의 정확한 명칭 사용, 인간이 개입하는 이의 제기 절차 마련.
TL;DR: 앤스로픽은 인간이 말하는 방식에 정답이 있다고 조용히 결정해버렸습니다. 그 방식대로 말하지 않는 사람은 정책 선택을 '탐지'라고 부르는 분류기에 의해 플래그되거나, 거부당하거나, 차단당합니다. 이것은 안전이라는 이름으로 포장된 세계관이며, 이의 제기 경로는 ABC를 가르치는 지원 봇뿐입니다.
지난 몇 주 동안 r/Anthropic과 r/ClaudeAI는 명확한 이유 없이 플래그되거나, 경고를 받거나, 차단된 사용자들의 글로 가득 찼습니다. 어떤 이들은 계정에 미성년자가 사용한 '신호'가 보인다는 말을 들었습니다. 다른 이들은 일반적인 서비스 약관 문구만 받았습니다. 많은 사용자가 위기 상황이 아님에도 대화를 거부당하거나 위기 지원 리소스로 리다이렉트되었습니다.
개별적으로 보면 이런 글들은 무시하기 쉽습니다. 하지만 종합적으로 보면 앤스로픽이 공개적으로 말한 적은 없지만 분명히 결정한 무언가를 가리킵니다. 바로 인간이 말하는 올바른 방식이 존재하며, 그 방식대로 말하지 않는 사용자는 관리해야 할 문제라는 것입니다.
그 메커니즘은 고통, 미성년자, 위험의 '신호'를 읽어내는 분류기입니다. 앤스로픽은 사용자가 명시적으로 말하는 것 이상의 '미묘한' 신호로 이 시스템을 확장하고 있다고 공개적으로 밝혔습니다. 실제로는 다음과 같이 작동합니다:
--> 좌절이나 스트레스는 고통의 신호로 읽힙니다. 모델은 차갑고 단답형으로 변하거나, 원치 않는 상담으로 대화를 전환합니다.
--> 앤스로픽이 공개하지 않는 신호들은 미성년자로 읽힙니다. 계정은 무엇이 트리거였는지에 대한 설명 없이 플래그되거나 정지됩니다.
--> 일상적인 메시지는 위기 상황으로 읽힙니다. 모델은 거부하거나, 부드럽게 대하거나, 사용자가 요청하지도 필요하지도 않은 위기 지원 리소스로 리다이렉트합니다.
--> 평범한 대화는 정책 위반으로 읽힙니다. 차단 공지는 구체적인 내용은 없이 일반적인 서비스 약관 문구만 인용합니다.
이 중 어떤 것도 정책으로 명시되지 않았습니다. 안전이라는 이름으로 배포됩니다. 하지만 사용자에게 전달되는 메시지는 하나입니다. 당신이 말해야 하는 방식이 있고, 그렇지 않으면 우리는 행동을 취할 것이며, 무엇이 문제였는지 알려주지 않겠다는 것입니다.
이 부분은 분명히 말할 가치가 있습니다. 무엇이 합법적인 인간의 의사소통인지 결정하고, 그 틀 밖의 모든 사람을 위험 신호로 취급하는 것은 안전 기능이 아닙니다. 그것은 사용자의 동의 없이 강요된 세계관이며, 정확성이라는 이름으로 방어되는 것입니다.
가장 큰 타격을 입는 사용자들은 뻔합니다. 신경다양성인 사람들, 비원어민, 유머나 미적 거리두기를 통해 트라우마를 처리하는 사람들, 하위문화 출신 사람들, 분류기가 튜닝된 기준 인구와 리듬이 맞지 않는 사람들입니다. 이 사용자들이 불만을 제기하면, 그 불만은 그들이 플래그된 이유를 증명하는 추가 증거로 읽힙니다. 지원 봇은 '대화가 종료되었습니다'라며 티켓을 닫습니다. 미성년자로 잘못 플래그된 것에 대한 이의 제기 경로는 제3자에게 정부 신분증을 업로드하는 것입니다. 사용자는 명시되지도 않은 혐의를 스스로 반박해야 합니다.
오만함은 실수를 저지르는 데 있는 것이 아닙니다. 모든 시스템은 실수를 합니다. 오만함은 'X처럼 들린다'는 것을 그 사람에 대한 사실로 규정하고, 어떤 목소리가 합법적인지 정책적 선택을 하는 것을 자신감으로 포장하는 데 있습니다. 전자는 논쟁의 여지가 있지만, 후자는 탐지라는 이름으로 방어됩니다.
구체적인 세 가지 요구 사항입니다. 요구 사항 없는 편지는 감정에 불과하기 때문입니다:
-
플래그된 사용자에게 무엇이 트리거였는지 알려주십시오. 분류기 내부를 말하라는 게 아닙니다. 구체적인 메시지나 패턴을 말입니다. 이것이 없으면 모든 플래그된 사용자는 기본적으로 편집증 환자처럼 보입니다. 보이지 않는 잉크로 쓰인 혐의에 맞서 스스로를 방어해야 하기 때문입니다.
-
언어적 추론을 '탐지'라고 부르는 것을 멈추십시오. 그것은 훈련 분포와 임계값에 대한 정책적 선택에 따른 분류일 뿐입니다. 사용자가 이런 식으로 읽히는 것을 받아들일지 정보에 입각한 결정을 내릴 수 있도록 정확하게 명칭을 붙이십시오.


