GPT-5.5 vs GPT-5.4 vs Opus 4.7: 56개 실전 코딩 작업 벤치마크 비교
GPT-5.5 vs GPT-5.4 vs Opus 4.7 on 56 real coding tasks from 2 open source repos
핵심 요약
GPT-5.5가 코드 품질과 리뷰 통과율에서 가장 우수한 성능을 보였고, Opus 4.7은 패치 크기 면에서 강점을 드러냄.
- 모델별 성능 비교 — GPT-5.5가 코드 리뷰 통과율과 정확도 면에서 가장 뛰어난 성과를 기록함.
- 패치 크기 전략 — Opus 4.7은 더 작고 간결한 패치를 작성하지만, 때때로 구현이 불완전한 모습을 보임.
- 실전 벤치마크 중요성 — 공개 벤치마크와 달리 실제 코드베이스에서의 작업 효율과 워크플로우 결정이 중요함.
- 평가 프레임워크 Stet — 코드 리뷰 적합성, footprint 위험도, craft/discipline 등 다각도로 모델을 평가함.
TLDR; OpenAI가 GPT-5.5로 제대로 한 건 해냈음.
Opus 4.7은 더 작은 패치를 작성함. GPT-5.5는 리뷰를 통과할 확률이 더 높은 패치를 작성함. 어떤 모델을 선택할지는 당신의 레포지토리에서 '작은 패치'가 절제된 코드인지, 아니면 불완전한 코드인지에 따라 달라짐.
나는 두 개의 오픈소스 레포지토리에서 56개의 실전 코딩 작업을 대상으로 두 모델과 GPT-5.4를 테스트했음: Zod에서 27개 작업, graphql-go-tools에서 29개 작업(이 코드베이스들은 임의로 선택되었으며 당신의 경험을 대변하지 않을 수 있음 - 이것이 바로 직접 벤치마크를 돌려보는 것이 중요한 이유임!) 각 모델은 기본 설정의 네이티브 에이전트 하네스에서 실행되었음: Anthropic 모델은 Claude Code에서, OpenAI 모델은 OpenAI Codex CLI에서 실행함.
결과는 '한 모델이 모든 것을 압살한다'는 아니었음. GPT-5.5는 이번 실행 전반에서 가장 신뢰할 만한 기본 모델이었음. 여기서 '신뢰할 만하다'는 것은 테스트를 통과하고, 의도한 인간의 변경 사항과 일치하며, 코드 리뷰를 통과하는 패치를 생성할 것이라고 가장 자주 믿을 수 있는 모델을 의미함. Opus 4.7도 여전히 가치 있는 작업을 수행했는데, 훨씬 더 작은 패치를 작성했다는 점임.
Zod에서는 이것이 실제 트레이드오프처럼 보였음. graphql-go-tools에서는 구현 미흡에 더 가까워 보였음.
GPT-5.5는 더 자주 통과함. Opus 4.7은 더 작게 작성함. 당신의 레포지토리에서 무엇이 승리할지는 당신의 병목 현상이 리뷰인지, 아니면 코드 점유율인지에 달려 있음.
이러한 차이가 바로 레포지토리별 평가가 중요한 이유임. 공개 벤치마크는 모델의 행동을 거대한 규모로 집계된 하나의 숫자로 평준화해버림. 실제 코드는 이를 당신의 특정 코드베이스와 표준에 맞춘 워크플로우 결정으로 바꿈.
나는 실제 레포지토리 코딩 에이전트 벤치마크를 위해 구축 중인 평가 프레임워크인 Stet을 사용하여 단순히 테스트 통과 여부뿐만 아니라 인간 패치와의 행동적 동등성, 코드 리뷰 수용 가능성, 점유율 위험도, 그리고 기술적 절제력을 평가했음. 이 게시물은 모든 코딩 작업에 대한 주장이 아님. 세 가지 최신 모델이 두 개의 실제 코드베이스에서 어떻게 행동했는지에 대한 구체적인 모습임.
|Model|Harness|Reasoning Level|
|:-|:-|:-|
|Opus 4.7|Claude Code|high|
|GPT-5.4|Codex CLI|high|
|GPT-5.5|Codex CLI|high|
요약 버전
56개의 점수화된 작업 결과:
|Metric|Opus 4.7|GPT-5.4|GPT-5.5|
|:-|:-|:-|:-|
|Tests pass|33/56|31/56|**38/56**|
|Equivalent to human patch|19/56|35/56|**40/56**|
|Clean pass: tests + review|10/56|11/56|**28/56**|
|Mean footprint risk, lower is better|**0.20**|0.34|0.32|
|Mean time/task|11m18s|8m24s|**6m56s**|
|Estimated run cost|$3.43|**$2.39**|$2.86|
GPT-5.5가 품질 면에서 선두임. 가장 많은 테스트를 통과하고, 인간 패치와 가장 자주 일치하며, Opus보다 약 3배 더 자주 리뷰어를 통과함.
Opus는 점유율(footprint) 면에서 선두임. Stet의 점유율 모델에 따르면 패치가 더 작고 위험도가 낮음. 하지만 작은 패치는 완전할 때만 좋은 것임. Opus의 반복적인 실패 모드는 눈에 보이는 테스트는 통과하지만 인간 PR에 포함된 동반 작업을 놓치는 것임.
GPT-5.5는 토큰과 실제 소요 시간 면에서도 효율성 선두임. 경쟁 모델보다 더 적은 입력 토큰, 더 적은 출력 토큰, 더 적은 에이전트 시간을 사용했음. GPT-5.4는 가격이 더 저렴해서 비용 면에서는 여전히 선두이지만, 이번 실행에서는 비용 이점이 클린 패스(clean-pass) 격차를 상쇄하지 못했음.



