ChatGPT-5.5, 현실적인 벤치마크(DeepSWE)에서 Opus를 앞서다
ChatGPT-5.5 Beats Opus in Realistic Benchmark (DeepSWE)
핵심 요약
새로운 코딩 벤치마크 DeepSWE가 기존 SWEbench Pro의 한계를 보완하며 실제 개발 환경과 유사한 결과를 보여줍니다.
- DeepSWE 벤치마크 — 실제 코딩 작업과 유사한 복잡도와 검증 방식을 도입함
- 모델 성능 비교 — ChatGPT-5.5가 70%로 Opus의 54%를 앞서며 실질적인 코딩 왕좌를 차지함
- 기존 벤치마크 한계 — SWEbench Pro는 모델의 실제 실력을 제대로 반영하지 못하는 경향이 있음
- 사용자 경험 일치 — 벤치마크 결과가 실제 개발자들이 느끼는 모델 성능 체감과 더 잘 부합함
웹사이트에서 홍보하는 내용은 다음과 같습니다:
- 오염 없음: 작업은 처음부터 새로 작성되었으며 기존 커밋이나 PR에서 가져온 것이 아니므로, 사전 학습 중에 어떤 모델도 해결책을 본 적이 없습니다.
- 높은 다양성: 작업은 5개 언어에 걸쳐 91개의 리포지토리로 구성된 광범위한 풀을 다룹니다.
- 실제 복잡성: 프롬프트는 SWE-bench Pro보다 길이가 절반 정도지만, 해결책을 위해서는 5.5배 더 많은 코드와 약 2배 더 많은 출력 토큰이 필요합니다.
- 신뢰할 수 있는 검증: 검증기는 구현 세부 사항이 아닌 소프트웨어 동작을 테스트하기 위해 직접 작성되었습니다.
그리고 점수들은 LLM을 사용하여 실제 코딩을 할 때의 실제 경험과 더 일치합니다. 예를 들어, Gemini 3.1 Pro는 실제로는 아무것도 못 한다는 걸 우리 모두 알지만 SWEbench Pro에서는 꽤 괜찮은 점수를 받는 경향이 있습니다. 이 벤치마크에서는 약 18%를 기록했죠. Mythos가 나와야 합니다! ChatGPT-5.5가 현재 실제 코드 변경의 왕인 것 같습니다. Opus는 조금 뒤처지네요... GPT는 70%, Opus는 54%입니다.
SWEbench Pro와 그 점수에 대한 비판이 상세하게 논의되고 있습니다. 흥미로운 내용이 많죠. 예를 들어, SWEbench Pro 프롬프트는 LLM에게 테스트를 작성하지 말라고 지시합니다. Claude는 약 20%의 확률로 테스트를 작성하는 반면, GPT는 약 10%만 그렇게 했습니다. 지시를 따르지 않음으로써 Opus가 그런 방식으로 일부 테스트 케이스에서 앞서 나갈 수 있었던 겁니다. deepSWE에서는 테스트 프롬프트가 구체적으로 명시하지 않기 때문에, 도전 과제가 주어졌을 때 LLM이 무엇을 선택하는지 더 잘 볼 수 있습니다. GPT와 Opus 모두 80~90%의 확률로 테스트를 작성했는데, 이는 일반적으로 좋은 행동입니다.
SWEbench Pro의 방법론과 비판을 깊이 읽고 싶지 않다면, 전체 이야기를 설명하는 이 수정 사항을 아무리 강조해도 지나치지 않습니다. 요약본을 원하신다면 여기 결과 그래프를 보세요. 왼쪽에는 SWEbench Pro 점수가 있고, 오른쪽에는 deepSWE 점수가 있습니다. LLM을 사용하여 실제 다단계 코딩 문제를 해결할 때의 실제 경험과 일치하는 방향으로 큰 수정이 이루어진 것을 볼 수 있습니다. 제 말은, Haiku가 30%라고요? 아니요, 실제로는 0%여야 맞습니다. Gemini 3.1 Pro가 경쟁력 있는 수준에서 완전히 쓰레기 수준으로 떨어진다고 이미 언급했는데, 이는 프로그래머들이 실제 작업을 할 때 Codex와 Claude Code 외에는 아무것도 사용하지 않는다는 사실과 일치합니다.
GPT-5.4와 GPT-5.5가 SWEbench Pro에서 약 58.5%로 비슷한 점수를 받는 것도 말이 안 되지만, 이 deepSWE에서는 GPT-5.5가 56%에서 70%로 올라가며 GPT-5.4를 압도합니다. Gemini 3 flash나 Haiku-4.5 같은 작은 모델들이 35~40% 정도의 점수를 받는다고요? 실제로는 0%에 가깝습니다. 그리고 이 벤치마크는 마침내 Opus-4.7이 Sonnet-4.6보다 얼마나 더 나은지 보여줍니다. Sonnet은 여전히 간단한 문제에는 훌륭한 일꾼이지만, deepSWE에서 볼 수 있는 실제 코드베이스의 다단계 도전 과제에 관해서는 Opus가 54%를 기록한 반면 Sonnet은 32%에 그쳤습니다.
Kimi 2.6, mimo v2.5 Pro, glm-5.1, deepseek v4 pro 모두 gpt-5.4-mini보다 낮은 점수를 받았습니다. 아프네요. 오픈 웨이트 모델들은 코딩을 그렇게 잘하지 못합니다. 한 가지 변수는 deepSWE와 SWEbench Pro의 프롬프트 스타일일 수 있습니다. DeepSWE는 훨씬 더 자연스러웠습니다. "여기 문제가 있고, 이렇게 되길 원해." SWEbench Pro는 10단계 정도의 프롬프트를 제공하며 모델에게 코드 변경에 어떻게 접근해야 할지 더 많이 지시했습니다. 1단계, 2단계 등등. Opus 4.7은 Opus 4.6의 28%와 비교해 54%를 기록했으니, 4.7은 다중 파일, 다단계 코드 변경에서 기본적인 프롬프트를 사용할 때 실제로 큰 도약을 이뤄낸 것입니다.
Anthropic 팀은 당장 Mythos 2CC가 필요합니다!


