Claude Fable 5와 Opus 4.8을 917개의 코딩 에이전트 시나리오로 테스트함. Fable이 0.9점 차이로 승리.
tested Claude Fable 5 and Opus 4.8 across 917 coding-agent scenarios. Fable won by 0.9 points.
핵심 요약
Claude Fable 5와 Opus 4.8의 코딩 성능을 비교한 결과, 일상적인 에이전트 작업에서는 성능 차이가 미미함에도 가격 차이는 컸습니다.
- 성능 비교 — Fable 5가 92.9점, Opus 4.8이 92.0점으로 근소한 차이를 보임
- 비용 효율성 — Fable 5가 Opus 4.8보다 약 73% 더 비싼 비용이 발생함
- 실무 활용도 — 일상적인 에이전트 작업에서는 최상위 모델의 성능 차이가 크지 않음
- 모델 평가 — 복잡한 리버스 엔지니어링 등 특정 분야에서는 Fable의 강점이 드러날 수 있음
Claude Fable 5와 Opus 4.8을 917개의 공유 코딩 에이전트 시나리오에서 비교하여, 첫 번째 공개 Mythos급 모델이 일상적인 에이전트 워크로드에서 실제로 어떤 모습인지 확인했습니다. 참고로 저는 Tessl에서 일하고 있습니다.
작업들은 https://tessl.io/registry 의 스킬에서 가져왔으며, 관련 스킬을 로드한 경우와 로드하지 않은 경우 모두 평가했습니다. 모델과 스킬의 영향을 독립적으로 측정하기 위해 작업 평가 프레임워크를 사용했습니다.
주요 결과:
- Fable 5: 전체 점수 92.9점, 작업당 약 $1.25
- Opus 4.8: 전체 점수 92.0점, 작업당 약 $0.74
측정한 작업에서 0.9점의 성능 향상을 위해 약 73%의 비용을 더 지불하는 셈입니다.
Fable 5는 Opus가 성공적으로 완료한 26개의 작업을 거부했습니다. 일부는 보안 검토 작업이었고, 다른 것들은 일상적인 생물정보학 워크플로우였습니다. 전체 스킬 목록은 여기, 평가 방식은 여기에서 확인할 수 있습니다. Anthropic은 초기 출시의 일부가 지나치게 보수적이었음을 이미 인정했으므로, 앞으로 어떻게 발전할지 지켜보는 것도 흥미로울 것입니다.
제가 가진 실질적인 의문은, 사람들이 추가 비용을 정당화할 만큼 충분한 성능 향상을 실제로 체감하고 있느냐는 것입니다.
혹시 여기 계신 분들 중에 Claude Code 워크플로우를 Opus에서 Fable로 바꾸신 분 계신가요? 바꾸셨다면 어떤 작업에서 업그레이드할 가치를 느끼셨나요?
전체 벤치마크, 방법론 및 모든 결과: https://tessl.io/blog/claude-fable-5-vs-opus-48-the-mythos-hype-meets-reality/


