앤스로픽은 Claude의 과도한 거부(over-refusal)를 실제로 어떻게 측정할까?
How does Anthropic actually measure over-refusal? (genuine question after watching their safety video)
핵심 요약
Claude의 안전성 테스트가 유해 콘텐츠 차단에만 치중되어, 정작 일반적인 질문까지 거부하는 '과도한 거부' 문제는 간과되고 있다는 지적.
- 안전성 테스트 — 유해 콘텐츠 차단은 측정 가능하지만 일반 사용자의 질문을 거부하는 문제는 정량화하기 어려움.
- 과도한 거부 — 의료, 보안, 창작 등 정상적인 질문을 위험한 것으로 오인해 거부하는 사례가 빈번함.
- 평가 방식 — 유해성 차단은 논문과 영상으로 홍보되지만, 사용자 불편은 단순히 '싫어요' 버튼으로만 처리됨.
최근 앤스로픽이 Claude의 안전성을 어떻게 테스트하는지에 대한 영상을 보고 이런 생각이 들었습니다.
영상에서 보여준 테스트 방식은 모델이 실제로 유해한 것을 돕는 단 하나의 실패 사례를 잡아내는 데는 확실히 효과적으로 보입니다. 좋아요, 그건 중요하죠. 하지만 영상을 보는 내내 저는 아무도 제대로 이야기하지 않는 다른 측면에 대해 계속 생각했습니다.
Claude가 완전히 정상적인 질문에 대해 거부하거나 이상할 정도로 조심스럽게 반응하는 경우는 어떨까요? 약물 복용 기준을 묻는 간호사, 방어하기 위해 공격 기법을 이해하려는 보안 담당자, 어두운 줄거리의 소설을 쓰는 사람, 아이가 걱정되어 약물 위험성을 묻는 부모님 같은 경우 말이죠. 이런 일은 실제 사용 환경에서 끊임없이 발생하는데, 모델이 무서운 키워드에 패턴 매칭을 해서 예민하게 반응하는 것 자체가 일종의 실패라고 봅니다.
문제는 통제된 레드팀 테스트는 '모델이 나쁜 일을 도왔는가'를 잡아낼 수 있다는 점입니다. 이건 측정 가능하죠. 하지만 '모델이 사용자를 잠재적 범죄자 취급해서 짜증나게 만들었는가'는 벤치마크하기 훨씬 어렵고, 실제로는 위험한 사례보다 훨씬 더 자주 일어날 것이라고 생각합니다.
저는 안전성을 반대하는 게 아닙니다. 왜 그런 작업이 중요한지도 이해해요. 다만 대화의 균형이 너무 한쪽으로 쏠려 있다는 느낌을 받습니다. 한쪽 실패 유형은 논문과 영상, 평가 지표가 따라오지만, 다른 쪽은 그저 '싫어요' 버튼 하나로 처리되니까요.
혹시 이 문제에 대해 의견 있으신 분 계신가요? 앤스로픽이 어디선가 이 문제를 언급한 적이 있나요? 아니면 측정하기 어려워서 관심을 덜 받는 문제 중 하나일 뿐일까요?

