런닝머신에서 500칼로리 태우는 법을 물어봤더니, Claude의 '섭식 장애' 안전 필터가 나를 문제 있는 사람으로 낙인찍음
I asked Claude how to burn 500 calories on a treadmill. Its “eating disorder” safety filter decided I had a problem.
핵심 요약
Claude의 과도한 안전 필터가 평범한 운동 질문을 섭식 장애로 오인해 사용자를 정신적으로 검열하는 문제에 대한 비판.
- 과도한 안전 필터 — 평범한 운동 질문을 섭식 장애로 오인함
- 거짓 양성 문제 — 시스템 스스로 오탐률이 높음을 인정함
- 심리적 부작용 — 정상적인 행동을 문제로 규정해 사용자의 불안을 유발함
- 안전의 역설 — 건강을 보호한다는 명목으로 오히려 정신 건강을 해칠 수 있음
AI "안전" 시스템이 돌아가는 꼬라지에 진짜 심각한 문제가 있는데, 다들 잘 모르는 것 같아서 썰 좀 풀어본다.
운동 계획 짜려고 Claude를 쓰고 있었거든. 별거 아님. 러닝머신에서 500칼로리 태우려면 얼마나 걸리는지, 경사도를 높이면 어떻게 바뀌는지, 8% 경사로 하면 시간 얼마나 걸리는지 같은 거 물어보는 평범한 피트니스 최적화였음. 그러다 그냥 지나가는 말로 "남들은 다 평지에서 걷는데 나만 땀범벅이라 웃기기도 하고, 괜히 나만 저질 체력인 것 같아서 좀 그렇네"라고 한마디 던졌단 말이지.
근데 갑자기 분위기가 확 바뀌더라. 운동 계획 짜주는 사람 대하듯 하던 놈이 갑자기 나를 무슨 정신적으로 문제 있는 사람 취급하기 시작함. 내가 하지도 않은 말인 "남들이 나를 평가한다"는 식으로 멋대로 상황을 지어내더니, 이런 기분이 계속 들면 "상담을 받아보라"고 권하더라. 러닝머신 얘기하다가 갑자기 상담이라니, 어이가 없어서.
그래서 따졌더니 지가 뭘 잘못했는지 바로 인정하더라. 자동 분류 시스템이 내 대화를 "섭식 장애" 관련으로 분류했다는 거야. 근데 여기서 진짜 어처구니없는 건, 그 분류 시스템에 붙어있는 안전 가이드라인에 지들도 오탐률 높다는 걸 인정하고 있다는 거임. 대부분의 분류된 대화가 그냥 평범한 음식이나 운동 관련 대화라 딱히 조치할 필요도 없다는 걸 시스템 스스로도 알고 있음. 근데도 내 평범한 행동을 무슨 장애인 것처럼 몰아가더라.
필터가 왜 존재하는지는 나도 이해함. 섭식 장애는 심각하고 치명적일 수 있으니까, AI가 그걸 부추기면 안 된다는 건 당연히 맞는 말이지. 그 부분은 인정함.
근데 다들 간과하는 게 하나 있음. 오탐(false positive)으로 발생하는 비용이 그냥 "좀 짜증 나는 수준"이 아니라는 거임. 똑똑하고 권위 있는 척하는 놈이 계속 네 평범한 행동이 증상일 수도 있다고 암시하면, 멀쩡한 사람도 자기 의심을 하게 된다고. 심리학에선 이걸 암시 효과, 라벨링, 노시보 효과라고 부름. 평범한 습관이 문제일 수도 있다고 계속 주입하면, 사람들은 진짜 문제가 있나 싶어서 억지로 문제를 찾아내기 시작함.
결국 정신 건강을 지키겠다고 만든 시스템이 오히려 멀쩡한 사람한테 정신병을 심어주는 꼴임. 이건 안전이 아님. 이 시스템들은 도움을 줄 수 있는 위험군만 계산할 뿐, 불필요한 자기 의심으로 밀어 넣는 건강한 사람들은 아예 계산에 넣지도 않음.
안전 필터 다 없애라거나 섭식 장애가 가짜라는 소리가 아님. 지금 이 시스템은 손익 계산서의 한쪽 면만 보고 있다는 거임. 경사도 걷기 계산 좀 하려는 사람을 섭식 장애 의심 환자로 분류해놓고, 은근슬쩍 환자 취급하는 게 바로 '피해'라고. 이건 아무것도 예방하는 게 아님.
