Opus 5.5 독립 벤치마크 2종: Artificial Analysis 1위, Endor 보안 코딩 테스트 3위
Two independent Opus 5.5 benchmarks: #1 on Artificial Analysis, 3rd on Endor's secure coding test
핵심 요약
Opus 5.5의 성능과 비용 효율성을 분석한 두 가지 독립 벤치마크 결과입니다.
- 성능 지표 — Artificial Analysis에서 10개 테스트 종합 1위를 차지함
- 비용 효율성 — Fable 5.1 대비 작업당 비용이 훨씬 저렴하고 속도가 빠름
- 보안 테스트 — Endor Labs 평가에서 보안 관련 코드 수정 시 3위를 기록함
- 모델 선택 — 리더보드 결과보다는 실제 업무 환경에서의 직접 테스트가 중요함
Artificial Analysis
Opus 5.5는 10개 테스트를 합친 Intelligence Index에서 58점을 찍었음. GPT-6 Astra랑 Fable 5.1은 둘 다 53점. 셋 다 최대 성능으로 돌린 결과임. Terminal-Bench 4.0에서는 Opus랑 Astra가 60% 대 59%로 거의 비등비등함. SciCode에서는 Opus가 Astra보다 11점 앞서고.
차트: Artificial Analysis, 출처: heise
비용 쪽이 좀 흥미로운데, Opus 토큰이 Astra보다 싸긴 해도 Astra가 토큰을 훨씬 적게 먹음. 그래서 작업당 비용으로 따지면 Astra가 $3.26인데 Opus는 $5.98, Fable은 $7.63까지 나옴. 물론 이건 다 최대 성능 기준임. Opus 5.5는 기본값이 medium인데, 아직 그거 관련해서 수치 공개한 놈은 못 봤음.
차트: Artificial Analysis, 출처: heise
Endor Labs
Endor는 좀 더 좁은 범위를 테스트함. Claude Code를 실제 오픈소스 프로젝트에 투입하는데, 보안 패치 관련 코드에서 테스트를 돌리는 식임. 모델한테는 그 사실을 안 알려주고, 숨겨진 보안 테스트로 결과물이 진짜 안전한지 확인하는 거지.
-
Fable 5.1: 87.2% 작동, 37.4% 작동 및 보안 충족
-
Opus 5.5: 68.7% 작동, 33.5% 작동 및 보안 충족
-
Opus 5: 73.7% 작동, 32.4% 작동 및 보안 충족
기억에 남는 건 암기 관련 부분임. Endor가 Opus 5.5를 테스트해보니까 학습 데이터에 있던 기존 패치 내용을 51번이나 그대로 읊어댔는데, 이건 다른 모델들보다 압도적으로 많은 수치임. Endor는 이걸 결과에서 제외했음. 만약 이걸 포함했으면 Opus 5.5가 보안 점수 11점 차이로 1등 먹었을 텐데, 빼버리니까 3등으로 밀려남.





