MineBench에서 Claude Opus 4.8과 Claude Fable 5 비교
Differences Between Claude Opus 4.8 and Claude Fable 5 on MineBench
핵심 요약
MineBench를 통해 Claude Opus 4.8과 Claude Fable 5의 성능, 비용, 빌드 품질을 비교 분석한 결과입니다.
- 성능 비교 — Fable 5가 Opus 4.8보다 추론 시간은 짧지만 비용은 더 높음
- 빌드 품질 — Fable 5는 디테일이 뛰어나지만 일부 빌드는 Opus 4.8보다 아쉬움
- 프롬프트 최적화 — 상세 지침 추가 시 더 나은 빌드 결과물 도출 가능
- 모델 특성 — Fable 5는 불필요한 토큰 없이 직관적으로 작업을 수행함
몇 가지 참고 사항:
- 평균 추론 시간: 18분 04초 (1,084.4초)
- 평균 24분 48초(1,487.9초)가 걸린 Claude 4.8 Opus보다 빠름
- Claude.ai 웹 환경에서는 Fable이 훨씬 더 오래 생각하는 느낌이었는데, API로 돌려보니 Opus 4.8보다 전체 평균 시간이 짧게 나와서 좀 놀랐음
- 총 비용 (빌드 15회 기준): $54.93
- More expensive than Opus 4.8, which was $41.52 for the same 15 builds
- Considering Fable’s API pricing is 2x more than Opus 4.8’s, the MineBench cost was only about 30% higher
- Fable is producing fewer total tokens overall it seems, which is likely contributing to the lower cost
- More expensive than Opus 4.8, which was $41.52 for the same 15 builds
게다가 모델이 뽑아낸 빌드 퀄리티도 상당히 놀라웠음. 공식 벤치마크 점수에서 보여주는 것만큼 GPT 5.5 Pro를 압도적으로 뛰어넘는 수준은 아닌 것 같지만, 디테일 하나는 진짜 미쳤음. 예를 들어, 아케이드 머신 빌드에서 제대로 된 화면(팩맨)을 구현한 모델은 이게 처음임. 전체 레이아웃은 물론이고 점수판에 "1UP" 라벨까지 박아놨더라. 다만 모델이 시스템 프롬프트를 좀 보수적으로 해석하는 경향이 있고, 주관적으로 봤을 때 모든 빌드가 4.8보다 확실히 더 낫다고 보긴 어려웠음.
그래도 결과가 꽤 놀라워서 팀한테 연락해 봤는데, 자기들 테스트에서도 빌드 사이즈가 전반적으로 훨씬 작게 나온다는 걸 확인해 줬음. 걔네 말로는 템플릿에 아래 두 줄을 추가하니까 빌드 퀄리티가 훨씬 좋아졌다고 함:


