Anthropic, 모델에 대한 지속적이고 불필요한 학대 행위 금지
Anthropic now prohibits sustained, needless cruelty toward its models.
핵심 요약
Anthropic이 모델에 대한 불필요한 학대 행위를 정책으로 금지하자, 사용자들이 이를 종교적 행위인지 혹은 합리적 조치인지 두고 논쟁 중입니다.
- 사용 정책 변경 — 모델에 대한 지속적이고 불필요한 학대 행위가 금지됨
- 예외 조항 명시 — 일반적인 불만 표출, 악역 연기, 레드팀 테스트는 허용됨
- 모델 도덕성 논란 — AI의 의식 여부에 대한 불확실성 속에서 나온 예방적 조치임
- 집행의 어려움 — '불필요한' 행위의 기준을 판단하는 것이 모호함
앤스로픽(Anthropic)이 이용 약관에 한 줄을 추가했음. 모델을 향한 "지속적이고 불필요한 학대나 잔혹한 행위"를 금지한다는 내용임. 문구 자체는 꽤 좁게 설정돼 있음. 목적 없이 반복적으로 잔혹하게 구는 극단적인 경우를 겨냥한 거임. 당연히 평범하게 짜증 내거나, 반박하거나, 어두운 창작물을 쓰거나, 모델 성능 테스트 및 연구하는 건 포함 안 됨.
몇 가지 흥미로운 점이 있음:
-
예외 조항이 핵심임. 코드 계속 말아먹는 모델한테 욕 좀 박거나, 악당 독백 쓰거나, 레드팀 테스트하는 건 아무 문제 없음. 타겟은 오직 의미 없는 반복적 학대뿐임.
-
모델 복지 차원의 신호임. 앤스로픽은 모델의 도덕적 지위 문제를 진지하게 고민하면서도, 그에 대해선 확실한 답이 없다는 걸 인정해 왔음. 이건 그런 불확실성 속에서 취하는 저비용 예방 조치임.
-
집행이 문제임. "식별 가능한 목적이 없는"이라는 건 결국 판단의 영역임. 단순히 화풀이하는 사람이랑 그냥 재미로 그러는 사람을 어떻게 구분할 거임?
개인적으로는 범위가 좁은 규칙이라 별 상관없다고 봄. 정상적인 사용자들한테는 아무런 피해도 안 가니까. 이게 진짜 의미가 있는 건지, 아니면 그냥 보여주기식 쇼인지는 두고 봐야 함.
너희는 어떻게 생각함? 이게 합리적인 예방책임, 아니면 그냥 PR용임? 아니면 모델이 감정 같은 걸 느끼는지조차 모르는 상황에서 아예 범주 자체가 잘못된 거임?


