벤치마크 노트: Sonnet 5.5는 72에서 94/98로 점프, Opus 5.5는 훨씬 짧은 요청 시간으로 96/98 도달
Benchmark notes: Sonnet 5.5 jumps from 72 to 94/98; Opus 5.5 reaches 96/98 with much less request time
핵심 요약
Claude 5.5 모델들의 벤치마크 성능 향상과 효율성 개선을 분석한 결과입니다.
- 성능 향상 — Sonnet 5.5의 비약적인 점수 상승과 Opus 5.5의 안정적인 고득점 기록함.
- 효율성 개선 — 두 모델 모두 이전 세대 대비 요청 시간과 토큰 사용량이 크게 감소함.
- 도구 실행 — Sonnet은 여전히 도구 실행 안정성에서 개선의 여지를 보임.
- 비교 분석 — Astra High 모델과 비교했을 때 Opus 5.5가 근소하게 앞서거나 속도 면에서 경쟁함.
내가 MindTrial을 관리하는데, 이번에 Sonnet 5.5랑 Opus 5.5를 이전 모델들이랑 똑같은 98개 작업 세트로 테스트해 봤거든. 텍스트 작업 39개에 시각 작업 59개고, 파이썬이랑 과학 라이브러리 쓸 수 있게 해놨고 작업당 10번 호출 제한 걸었어. 아래에 있는 Claude 4개 실행 결과는 전부 xhigh 노력 라벨 썼고, 건너뛴 작업은 하나도 없어.
| Model | Passed | Hard errors | Model-request time |
|---|---|---|---|
| Sonnet 5 | 72/98 | 6 | 5:30:44 |
| Sonnet 5.5 | 94/98 | 1 | 1:23:07 |
| Opus 5 | 88/98 | 4 | 3:40:24 |
| Opus 5.5 | 96/98 | 0 | 0:58:35 |
Sonnet이 진짜 엄청나게 좋아졌어. 통과한 작업 22개 늘었고, 요청 시간은 74.9%, 출력 토큰(추론 포함)은 67.4%나 줄었거든. 새로 통과한 작업 24개 중에는 예전에 틀렸던 거 18개랑 에러 났던 거 6개가 포함돼 있어. 기존에 통과했던 거 2개는 다시 퇴보했고. 두 번째 시각 작업 모음에서는 Sonnet이 12/26에서 25/26으로 떡상했고, Opus는 24/26에서 25/26이 됐어. 이번 Claude 모델 둘 다 텍스트 작업 39개는 전부 다 통과했네.
Opus는 전체적으로 8개 더 통과했고 요청 시간은 73.4% 줄였어. Fable 5.1에서 통과했던 90개는 그대로 다 유지하면서 6개 더 맞혔네. 남은 실패작 2개는 사각형 세기랑 원 조각 맞추기야.
도구 사용 기록은 마냥 좋다고 하긴 좀 그래. Sonnet은 24개 작업에서 정의되지 않은 변수 에러(undefined-variable errors)가 41번이나 찍혔거든. 그래도 도구 호출 실패했던 작업 23개는 결국 통과하긴 했어. Opus는 정의되지 않은 변수 에러가 하나도 없고, 파이썬 호출 155번 중에 0이 아닌 종료(nonzero exits)는 딱 2번밖에 안 나왔어. 두 모델 다 이전 모델들보다 파이썬을 훨씬 덜 썼는데, Sonnet은 도구 호출이 529번에서 238번으로(55% 감소), Opus는 314번에서 155번으로(51% 감소) 줄었어.
그러니까 Sonnet 점수가 아무리 잘 나와도 도구 실행 안정성은 아직 좀 더 다듬어야 한다는 소리지. 로그 보니까 설정이 빠졌거나 상태 유지 관련해서 뭔가 착각하는 게 있는 것 같아.
Astra high랑 비교하면 Opus가 딱 1개 차이로 앞서네. 96개 대 95개야. 모델 요청 시간은 Opus가 살짝 덜 걸리는데, 파이썬 실행 시간까지 합치면 속도 비교가 뒤집혀. Opus는 1:17:18, Astra는 1:06:29거든.
Sonnet 통과율은 95.92%고, 에러 없이 완료된 작업 기준 정확도는 96.91%야. Opus는 치명적인 에러가 없어서 둘 다 97.96%고. 공식 점수는 바뀐 거 없고, 형식 안 맞거나 틀린 답을 수동으로 고친 것도 없어. 시간은 모델 요청 시간 합계고, 로컬 파이썬이랑 검증 시간은 뺀 거야. 전체 테스트 실행 시간은 아니니까 참고해.
전체 리더보드: 여기

