Opus 5, ProgramBench에서 새로운 SoTA 달성, 9/200 인스턴스 해결 (GPT 대비 4배 이상)
Opus 5 setting new SoTA on ProgramBench, solves 9/200 instances (>4x than GPT Sol)
핵심 요약
Opus 5가 ProgramBench에서 GPT를 능가하는 성과를 냈으나, 학습 데이터 오염 가능성과 높은 평가 비용에 대한 의문이 제기됨.
- 성능 지표 — ProgramBench에서 9/200 인스턴스를 해결하며 GPT 대비 4배 이상의 성과를 기록함.
- 데이터 오염 — 기존 오픈 소스 프로젝트를 재구축하는 방식이라 학습 데이터에 포함되었을 가능성이 제기됨.
- 평가 비용 — 모델 평가에 1만 달러라는 막대한 비용이 소요되어 효율성 논란이 있음.
- 평가 지표 — 유닛 테스트 통과율 등 다양한 지표를 통해 모델의 능력을 검증함.
ProgramBench는 에이전트한테 기존 커맨드 라인 프로그램(ffmpeg, sql 등)을 직접 다시 짜보라고 시키는 벤치마크임.
Opus 5가 ProgramBench에서 총 200개 과제 중 9개를 해결했는데, GPT 5.6 Sol보다 4배 넘게 잘한 수치임.
"거의" 해결할 뻔한 과제들까지 포함해서 보면 다른 지표에서도 비슷한 수준으로 발전하고 있는 게 보임.
참고로 Opus 5는 비용이 엄청나게 깨져서 평가 한 번 돌리는 데만 1만 달러(약 1,300만 원) 들어감.
전체 트래젝토리랑 자세한 정보는 programbench.com에서 확인 가능함.

