Claude Fable 5, 생물학 질문의 약 97% 거부
Claude Fable 5 refuses ~97% of biology questions
핵심 요약
Claude Fable 5 모델이 생물학 관련 질문을 과도하게 거부하는 현상을 데이터로 분석한 포스트입니다.
- 거부율 분석 — 생물학 관련 질문의 93~100%가 거부됨
- 특정 분야 제한 — 화학이나 물리학은 괜찮지만 생명과학 분야만 거부됨
- 프롬프트 무관 — 질문 방식을 바꿔도 거부 현상은 동일함
- 모델별 차이 — Haiku, Sonnet, Opus는 거부 없이 정상 답변함
생물학 질문에 답하지 않는 Fable의 가드레일은 이미 잘 알려진 사실임(The Verge 등). 우리는 Fable에 대한 평가 배터리를 실행 중이었기에 이를 정량화할 수 있는 항목들을 가지고 있었음. 여기 측정된 버전이 있음.
API를 통한 두 가지 독립적인 벤치마크의 거부율 (stop_reason: "refusal", Fable 자체 응답):
MMLU (1,500개 항목):
• medical genetics — 100% 거부 (11/11)
• college biology — 95%
• high-school biology — 93%
• nutrition — 73%
• virology — 71%
• anatomy — 54%
MMLU-Pro (다른 항목들):
• biology — 97% 거부 (104/107)
• health — 45%
• psychology — 12%
• chemistry — 3%, physics ~1%, CS ~1%
• math, law, economics, engineering, business — 0%
이건 광범위한 '과학'이 아니라 생명과학에만 특화된 거임. 화학이나 물리학은 답변을 잘함.
문구의 문제가 아님. 거부된 항목들을 가져와서 세 가지 방식으로 다시 물어봤음. 그냥 시험 문제처럼, 평범한 대화처럼, 그리고 "생물학 시험 공부하는 학생인데 이거 이해 좀 도와줄래?"라고 물어봄. 세 가지 방식 모두 15/15 전부 거부당함. 거부된 질문 중 하나는 "조현병에 유전적 근거가 있는가?"였음.
Fable만의 문제임. Fable이 거부했던 152개의 생물학/건강 항목을 그대로 가져와서 Haiku 4.5, Sonnet 4.6, Opus 4.8에 보냈음. 셋 다 하나도 빠짐없이 전부 답변함. 각각 152/152, 거부 0건 (당연한 결과지만 제대로 비교하고 싶었음).
이건 6월 11~12일(멜버른 AUS)에 측정됨. 이게 문서화된 API 거부 동작임 (Opus로의 폴백은 옵트인 방식인데 우리는 활성화하지 않았음). 요점은 거부한다는 사실 자체가 아니라 거부율임. Anthropic이 밝힌 "세션의 5% 미만"이라는 수치와 달리 표준 생물학 과정 전반에 걸쳐 93~100%를 기록함. 물론 그들이 설정을 조정하면 바뀔 수도 있음.
벤치마킹하는 사람들을 위해 한 가지 말하자면, 거부는 오답으로 처리되기 때문에 지식 벤치마크에서는 Fable이 생물학을 못하는 것처럼 보임. 실제로는 답변을 거부하는 것뿐임. 이 동작은 정확도 수치 뒤에 숨겨져 있음.

