Fable >>>> Opus 5
Fable >>>> Opus5
핵심 요약
사용자들이 벤치마크 점수와 달리 실제 체감 성능은 Fable 5가 Opus 5보다 훨씬 뛰어나다고 주장합니다.
- 체감 성능 차이 — Fable 5가 Opus 5보다 엔지니어링 작업에서 훨씬 유능하고 실수가 적음
- 벤치마크의 한계 — 합성 데이터 기반의 벤치마크가 실제 지능과 판단력을 제대로 측정하지 못함
- 모델별 목적 — Fable은 기획 및 복잡한 작업에, Opus는 작고 명확한 작업에 최적화됨
- 사용자 경험 — Fable은 인간 엔지니어처럼 행동하는 반면 Opus는 로봇처럼 느껴짐
다들 나만 그렇게 느끼는 건가, 아니면 Fable 5가 여전히 Opus 5를 완전히 압도하는 건가?
비슷한 작업에 둘 다 써봤는데, Fable 5는 유능한 엔지니어처럼 느껴짐. 뭘 '그냥 까먹거나', 이유 없이 완전히 엉뚱한 방향으로 새지 않음.
'창의적인' 측면에서 보면, Fable 5는 Opus 5보다 두 배 더 좋은 결과를 낸다는 걸 실제 지표로 증명했음. 비용 대비 어떤 게 더 최적인지 비교하려고 직접 블라인드 테스트를 여러 번 해봤거든.
그래서, 도대체 왜 벤치마크에서는 Opus 5가 더 높게 나오는 거임?
벤치마크가 측정하지 못하는 게 뭐지?
아니면 내가 그냥 운이 없었던 건가?


