Claude Opus 4.7 출시 하루 만의 벤치마크: Opus 4.6, Sonnet 4.6, Haiku 4.5 비교 및 실제 비용 추적
Claude Opus 4.7 benchmarked 1 day after release vs Opus 4.6, Sonnet 4.6, Haiku 4.5 — with real $ cost tracking
핵심 요약
Claude Opus 4.7의 성능과 비용을 이전 모델들과 비교 분석한 결과, Sonnet 4.6이 가성비 면에서 가장 뛰어난 선택지로 나타났습니다.
- 성능 향상 — Opus 4.7은 이전 버전 대비 14% 더 빠른 속도를 기록함.
- 비용 효율성 — Sonnet 4.6은 Opus와 동일한 정확도를 보이면서 비용은 5분의 1 수준임.
- 벤치마크 방식 — 10가지 코딩 및 작성 작업을 독립적인 LLM으로 평가함.
- 모델 추천 — 복잡한 작업이 아니라면 Sonnet 4.6을 기본 모델로 사용하는 것이 유리함.
Anthropic이 어제 Opus 4.7을 출시했습니다. 제가 다른 Claude 모델들에 사용하던 것과 동일한 10가지 작업 평가를 실행했고, 이번에는 토큰 단위의 비용 추적을 포함했습니다.
Opus 4.7 — 10/10 pass — 8.4s avg — $0.56 total
Opus 4.6 — 10/10 pass — 9.8s avg — $0.44 total
Sonnet 4.6 — 10/10 pass — 9.8s avg — $0.11 total
Haiku 4.5 — 8/10 pass — 4.6s avg — $0.03 total
예상치 못한 두 가지 사실이 있었습니다:
Opus 버전 업데이트로 인해 모델이 느려진 게 아니라 더 빨라졌습니다. 4.7은 동일한 작업에서 4.6보다 평균 14% 낮은 지연 시간을 보였습니다. 단위 테스트는 17.8초에서 13.3초로, README 작성은 22.7초에서 20.6초로 단축되었습니다.
Sonnet 4.6은 Opus와 동일한 정확도를 보이면서 비용은 5분의 1 수준입니다. 둘 다 10/10을 기록했습니다. 중간 정도 복잡도의 코딩 및 작성 작업으로 구성된 이 테스트 세트에서는 Sonnet과 Opus 사이에 정확도 차이가 없습니다. 에이전트 작업이 적대적이거나 긴 컨텍스트를 요구하는 작업이 아니라면, Sonnet이 더 나은 기본 모델로 보입니다.
작업 내용: CLI 생성, 버그 수정, CSV 분석, 단위 테스트, 리팩토링, 이메일 작성, 문서 요약, 셸 스크립트, JSON→CSV 변환, README 작성. 사람이 작성한 통과/실패 기준에 따라 독립적인 LLM이 평가했습니다.
작업당 1회 실행했으며, N=3으로 재실행한 분산 데이터가 곧 나올 예정입니다.

