Opus 4.8과 주요 AI 모델 비교 벤치마크 100개 이상 정리
Here's >100 evals for Opus 4.8 compared to top AI models
핵심 요약
Claude Opus 4.8의 100여 개 벤치마크 분석 결과, 수학과 코딩 성능은 크게 향상되었으나 법률 및 금융 분야는 정체된 것으로 나타났습니다.
- 성능 향상 지표 — 수학(USAMO 2026) 97% 달성 및 코딩 벤치마크에서 큰 폭의 점수 상승을 기록함.
- 경제적 가치 — GDPval-AA 벤치마크에서 275개 모델 중 1위를 차지하며 실무 능력을 입증함.
- 정체된 분야 — 법률, 의료, 금융 및 다국어 추론 능력은 이전 버전 대비 개선이 미미하거나 하락함.
- 사용자 피드백 — 새로운 'ultracode thinking' 설정과 함께 코딩 작업에서 체감 성능이 좋다는 반응임.
Opus 4.8에서 무엇이 바뀌었는지 확인하기 위해 100개 이상의 벤치마크를 긁어모았습니다.
4.7 대비 큰 폭의 상승:
- 수학: USAMO 2026 점수가 69%에서 97%로 급등
- 코딩: Vibe Code Bench +12 pp
- 경제적 가치: GDPval-AA에서 275개 모델 중 1위
- 생물학
- 긴 문맥 추론(Long-context reasoning)
하지만 몇몇 핵심 분야는 거의 개선되지 않았거나 오히려 나빠져서 놀랐습니다:
- 법률 추론
- 의료 / 의학
- 금융
- 다국어 추론
- 비즈니스 운영: Vending-Bench 2 점수가 거의 반토막 남
- 멀티모달: 섞인 결과(mixed results)
여기서 데이터를 더 자세히 살펴볼 수 있습니다: https://benchmarklist.com/models/anthropic-claude-opus-4.8/
지금까지 Claude code 내부에서 Opus 4.8을 사용해봤는데, 특히 새로운 /effort를 통한 ultracode thinking 설정이 아주 마음에 들었습니다.
여러분은 테스트해보면서 눈에 띄는 변화를 발견하셨나요?


