Ox Alpha 모델을 SWE-bench Verified Mini(50개 작업)로 벤치마크해봤는데 96% 성공함. 나조차도 의심스러움.
I benchmarked Ox Alpha on SWE-bench Verified Mini (50 tasks): 96% resolved. Now I’m skeptical of myself.
핵심 요약
Ox Alpha 모델이 SWE-bench에서 96%라는 놀라운 성공률을 기록했으나, 데이터 편향과 벤치마크 환경의 한계로 인해 신중한 해석이 필요함.
- 벤치마크 결과 — Ox Alpha가 50개 작업 중 48개를 해결하며 96%의 높은 성공률을 기록함.
- 데이터 편향 — 벤치마크 대상이 django와 sphinx로 한정되어 있어 학습 데이터 오염 가능성이 있음.
- 비교의 한계 — 전체 500개 작업이 아닌 50개 하위 집합을 대상으로 하여 타 모델과 직접 비교가 어려움.
- 모델 정체 — 커뮤니티에서는 해당 모델이 GLM 5.3 Flash일 가능성을 제기함.
TL;DR: 결과가 너무 좋아서 믿기 힘들 정도임. 그래서 오히려 올리는 거다. 공식 mini-swe-agent 스캐폴드(swebench.com Bash-Only 리더보드에서 쓰는 거랑 똑같은 거)를 써서 전체 SWE-bench Verified-Mini 세트에 Ox alpha를 돌려봤다. 결과는 48/50 = 96% 해결. 공식 SWE-bench Docker 하네스로 로컬에서 직접 검증했다. 비교하자면, Claude Fable 5가 앤스로픽이 직접 튜닝한 에이전트 스캐폴드로 95%를 찍고, 내가 쓴 거랑 똑같은 bash-only 스캐폴드에서는 최고 성능 모델들도 500개 전체 태스크에서 77% 정도밖에 안 나온다. 무료 티어 모델이 Fable 5를 넘겼다는 건 냄새가 난다는 뜻이지. 나도 의심스럽고. 아래 주의사항 꼭 읽어라. 내 점수가 뻥튀기됐을 만한 합리적인 이유들이 있으니까.
—— 설정 ——
• 모델: Ox alpha, opencode의 Go 게이트웨이를 통해 서비스됨
• 스캐폴드: mini-swe-agent v2.4.6 (공식 Bash-Only 리더보드 스캐폴드)
• 프롬프트/설정: 공식 swebench.yaml 툴 호출 템플릿, 모델만 바꿨고 나머지는 그대로; 단계 제한 250
• 데이터셋: swe-bench-verified-mini — SWE-bench Verified의 잘 알려진 50개 태스크 서브셋
https://huggingface.co/datasets/MariusHobbhahn/swe-bench-verified-mini
https://huggingface.co/datasets/princeton-nlp/SWE-bench_Verified
• 검증: 공식 swebench 하네스를 로컬에서 실행; 모든 FAIL_TO_PASS 및 PASS_TO_PASS 테스트를 통과해야만 해결로 간주
• 하드웨어: Windows 11 박스 1대, Docker Desktop (WSL2), 인스턴스당 컨테이너 1개
—— 결과 ——
• 해결: 48 / 50 = 96.0%
• 실패: django__django-11790, django__django-11815
• 빈 패치 / 에러: 0 / 0 (50개 전부 실제 패치 제출함)
• 평균 단계: 40 (최대 116)
• 총 소요 시간: 4개 병렬 워커로 약 2시간 4분
• 저장소별: django 23/25, sphinx-doc 25/25
—— SWE-BENCH VERIFIED에서 다른 모델들과 비교 ——
숫자에는 두 종류가 있다. 공식 Bash-Only 리더보드(swebench.com)는 모든 모델을 동일한 mini-swe-agent 스캐폴드로 돌리고(내 설정이랑 직접 비교 가능), 벤더들은 자기들이 튜닝한 에이전트 스캐폴드를 써서 점수를 자체 보고한다.
이번 실행: ox-alpha-free (mini-50 서브셋, 저장소 2개만) → 96.0% [bash-only 스캐폴드]
Claude Fable 5 (2026년 6월) → 95.0% [벤더 튜닝 에이전트]
Claude Opus 4.8 (2026년 5월) → 88.6% [벤더 튜닝 에이전트]
GPT-5.5 (2026년 4월) → 82.6% [벤더 튜닝 에이전트]
Claude Opus 4.6 (2026년 3월) → 80.8% 벤더 튜닝 / 75.6% bash-only
Claude 4.5 Opus high reasoning → 76.8% [bash-only 스캐폴드]
Gemini 3 Flash high reasoning → 75.8% [bash-only 스캐폴드]
GPT-5.2 → 72.8% [bash-only 스캐폴드]
마지막 세 줄이 제대로 된 비교군이다. 나랑 똑같은 스캐폴드를 썼지만, 12개 저장소에 걸친 500개 전체 태스크 대상이다. 내 결과는 django랑 sphinx만 포함된 50개 태스크짜리라 다른 줄보다 훨씬 쉬운 세트다. 무료 모델이 Fable 5 위에 있는 걸 보고 박수 칠 게 아니라 의심부터 해야 하는 이유가 바로 이거다. 이 똑같은 mini 데이터셋을 쓰지만 스캐폴드는 다른 HAL 리더보드에서는 1등이 72% 정도(SWE-Agent + Claude Sonnet 4.5, 구세대 모델)다.


