28개의 Zod 작업으로 본 Opus 4.7 vs 구형 Opus 4.6 vs 신형 Opus 4.6 비교
I ran Opus 4.7 vs Old Opus 4.6 vs New Opus 4.6 on 28 Zod tasks
핵심 요약
Opus 4.7은 이전 모델보다 더 정교하고 효율적인 코딩 능력을 보여주며, 특히 코드 변경의 불필요한 확장을 줄이는 데 강점이 있음.
- 성능 비교 — Opus 4.7은 4.6 대비 더 정교하고 일관된 코드 패치를 생성함.
- 비용 및 속도 — 4.7은 이전 모델보다 작업당 비용이 저렴하고 처리 속도가 빠름.
- 평가 지표 — 코드의 의도와 일치하는지 평가하는 'Equivalence'와 불필요한 변경을 측정하는 'Footprint risk'를 활용함.
- 모델 컨텍스트 — 모델마다 최적의 성능을 내는 프롬프트와 컨텍스트 구성 방식이 다를 수 있음을 시사함.
Opus 4.7 vs Old Opus 4.6 vs New Opus 4.6 on a 28-task Zod benchmark
모두가 Opus 4.6이 점점 멍청해지고 있다고 말합니다. 그러던 중 테스트 도중에 Opus 4.7이 출시되어 두 질문을 모두 처음부터 끝까지 실행해 보았습니다. 과연 최신 Opus 4.6이 3월 19일 자 Opus 4.6과 여전히 동일한 성능을 낼까요? 그리고 4.7은 실제로 더 나을까요?
세 가지 Opus 스냅샷, 28개의 역사적인 Zod 작업, 세 가지 모델 모두에서 동일하게 12/28의 테스트 통과율을 보였습니다. 단순 통과율로만 보면 업그레이드는 평범해 보입니다. 하지만 테스트 기준을 넘어서면 모델 간의 차이가 드러나는데, 유용한 멘탈 모델은 Opus 4.7이 범주적으로 더 나은 것이 아니라 방향성 있게 더 낫다는 것입니다.
Opus 4.7은 근본적으로 더 똑똑해진 것이 아니라, 더 절제된 코더로 보입니다.
비용, 토큰, 작업 시간 측면에서 보면: 4.7은 3월 자 4.6보다 작업당 비용이 저렴하고($8.11 vs $8.93), 총 토큰 사용량도 적으며(44.0M vs 49.1M), 28개 작업 전체를 더 빨리 완료합니다(1시간 30분 vs 1시간 36분). 최신 4.6이 가장 저렴하지만, 더 느슨하고 품질이 낮은 패치를 만드는 데 2.3배 더 오래 걸립니다.
저는 Stet을 만들고 있는데, 이 도구는 패스/페일 여부를 넘어 등가성, 풋프린트, 기술력, 절제력을 기준으로 이러한 실행 결과를 점수화합니다. Zod는 고수준 벤치마크가 아닌 구체적이고 실질적인 저장소로 선택되었으며, 내부 저장소에서도 비슷한 양상을 보았습니다.
| Arm | Reasoning effort | What it represents |
| ------------------------ | ---------------- | ---------------------------------------------- |
| Opus 4.6, March 19, 2026 | high | Earlier Opus 4.6 run on this same task set |
| Opus 4.6, April 16, 2026 | high | Fresh Opus 4.6 rerun on the same task set |
| Opus 4.7, April 16, 2026 | high | Fresh Opus 4.7 run on the same task set |
방법론:
- Zod에서 병합된 커밋을 샘플링하여 기준점으로 삼음
- 각 Opus 스냅샷을 Claude Code에서 실행하여 동일한 변경 사항을 재현
- 각 패치와 테스트 통과율을 다음 기준으로 점수화:
- Equivalence(등가성) — 테스트 통과 여부와 상관없이 패치가 의도한 문제를 해결하는가?
- Code-review pass(코드 리뷰 통과) — 이진법: 패치가 병합할 가치가 있는가?
- Footprint risk(풋프린트 위험) — 패치가 승인된 변경 사항과 얼마나 다른가? 낮을수록 좋음.
- Craft(기술력) (0–4) — 단순성, 일관성, 의도성, 견고함, 명확성.
- Discipline(절제력) (0–4) — 지시 준수, 범위 절제, 최소한의 diff.
채점 참고: 채점자는 gpt-5.4이며, 세 가지 모델 모두 동일한 루브릭 버전을 사용했습니다. 각 패치는 독립적으로 점수화됩니다. 채점자는 패치와 작업만 볼 뿐, 모델 이름이나 라벨은 보지 못합니다. 이중 평가자 보정이 없으므로 절대 점수는 방향성으로만 참고하고, 모델 간의 차이(delta)를 신뢰하십시오.


