Claude 5.5는 미쳤습니다. 벤치마크를 거의 박살 낼 뻔해서 버그인 줄 알았습니다.
5.5 is IN-SANE. It almost broke our benchmark. I thought it was a bug.
핵심 요약
Claude Opus 5.5가 자체 작문 벤치마크에서 압도적인 1위를 차지하며 이전 모델들과 큰 격차를 보였습니다.
- 압도적 성능 — 벤치마크 점수 2631점으로 2위와 300점 이상의 큰 격차를 기록함
- 설정별 효율성 — Max 설정은 최고 성능을 내지만 17분 소요로 매우 느린 속도를 보임
- 벤치마크 방식 — 3명의 AI 심사위원이 작가의 문체와 스토리텔링 능력을 블라인드 평가함
- 실사용 팁 — 일반적인 작업에는 High 설정이 적합하며, 최고 품질이 필요할 때만 Max 사용 권장
Claude Opus 5.5가 우리 글쓰기 벤치마크에서 압도적인 1위를 차지했다. 그냥 1위도 아니고 격차가 장난이 아님.
2631 Elo를 찍었다. 2위인 Fable이 2324니까 무려 307점 차이임. 2026년 6월에 벤치마크 시작한 이후로 이렇게 큰 격차가 벌어진 건 처음이다.
게다가 우리 평가 기준에서 100점 만점에 91점을 넘긴 첫 번째 모델이기도 함.
한 가지 알아둘 점은, 최대 성능(max effort)으로 돌리면 스크립트 하나 쓰는 데 17분 걸리고 비용도 $3.43이나 깨진다는 거다. 전체 모델 중에서 압도적으로 제일 느림. 제일 비싼 건 아니지만, 비싼 순위로 따져도 5위 안에는 든다.
Opus 5.5 설정별 성능은 아래와 같다.
(총 167개 모델 설정으로 진행한 내부 글쓰기 벤치마크 결과:)
max: 1위, 2600 Elo, $3.43, 스크립트당 17분
xhigh: 2위, 2399 Elo, $0.86, 4.4분
high: 3위, 2342 Elo, $0.34, 1.7분
adaptive (no effort flag): 6위, 2264 Elo, $0.21, 1.0분
medium: 10위, 2199 Elo, $0.21, 1.1분
low: 20위, 2144 Elo, $0.17, 0.8분
기존 1위였던 Claude Fable 5.1(max 설정)은 2303 Elo에 스크립트당 $3.15였다.
몇 가지 핵심 요약:
- xhigh는 Fable보다 100 Elo 가까이 높으면서 가격은 1/4 수준임
- high도 Fable을 이기는데 가격은 대략 1/9밖에 안 됨
- max는 다른 모델들보다 200 Elo나 높지만, xhigh보다 4배 비싸고 17분이나 걸림
- Claude 서브 에이전트로 no-effort 플래그를 쓰면, Opus 5.5가 알아서 판단해서 medium이랑 high 사이 정도 성능을 냄
웬만한 글쓰기 작업에는 high 설정이 가성비 최고인 듯하다. 진짜 최고의 초안이 필요하고 시간 여유가 있을 때만 Max를 써라. 우리 프롬프트가 워낙 디테일하고 길어서 Max가 제 성능을 발휘하는 것 같다.



