DeepSWE에 Opus 4.8 추가됨
Opus 4.8 just landed on DeepSWE
핵심 요약
DeepSWE 리더보드에서 Opus 4.8이 GPT-5.5보다 낮은 성능을 기록하자, 실제 체감 성능과 벤치마크 결과의 괴리에 대해 논쟁이 벌어짐.
- 벤치마크 결과 — Opus 4.8이 58% pass@1로 GPT-5.5의 70%보다 낮게 측정됨
- 체감 성능 논란 — 작성자는 Opus가 GPT-5.5와 비슷하거나 더 낫다고 느낌
- 에이전트 영향 — 동일한 mini-swe-agent 사용이 특정 모델에 유리할 가능성 제기
- 사용자 반응 — 대부분의 사용자가 GPT-5.5의 우위를 인정하며 Opus 4.8에 실망함
DeepSWE 리더보드에 Opus 4.8이 추가됐어. 결과는 58% pass@1 (max 설정)인데, GPT-5.5 (xhigh)는 70%야. 심지어 GPT-5.4도 56%로 Opus를 살짝 앞서네.
솔직히 Opus 4.8이 GPT-5.5보다 못하다는 게 잘 상상이 안 가. 평소 코딩할 때 Opus는 최소한 동급이거나 종종 더 낫다고 느끼거든.
그래서 이 격차가 어디서 오는지 궁금해. 모든 모델이 같은 에이전트(mini-swe-agent)에서 돌아가는데, 그게 특정 모델한테 유리하게 작용하는 걸까? 아니면 GPT-5.5가 이런 종류의 벤치마크에서 실제로 앞서 있는 걸까?
너희들 경험이랑은 좀 맞아, 아니면 전혀 달라?


