Opus 5의 '지시 이행' 점수가 다른 모델들에 비해 왜 이렇게 낮은 건가요?
How come Opus 5 has such a low "instruction-following" score compared to the rest?
핵심 요약
Opus 5의 낮은 지시 이행 점수에 대해 벤치마크의 신뢰성, 모델의 과도한 안전성, 학습 방향성 등을 두고 논의가 이어지고 있습니다.
- 벤치마크 신뢰성 — Gemini의 컨텍스트 압축 문제로 인해 해당 벤치마크 결과가 왜곡되었을 가능성이 제기됨
- 모델 학습 방향 — Opus 5가 벤치마크 점수 향상에만 치중하여 실제 지시 이행 능력이 떨어졌다는 의견이 있음
- 과도한 안전성 — Anthropic의 엄격한 윤리 가이드라인이 모델의 지시 이행을 방해하고 있다는 분석이 나옴
- 실제 사용 경험 — 사용자들이 Opus 5의 지나치게 방어적인 태도와 지시 거부 사례를 공유함


