Apex-Testing: 실제 저장소 기반 에이전트 코딩 벤치마크 업데이트
Apex-Testing: real-world, real repos, agentic coding benchmark (Update)
핵심 요약
실제 비공개 깃허브 저장소를 활용해 모델의 코딩 능력을 검증하는 Apex-Testing 벤치마크가 업데이트되었습니다.
- 실제 환경 테스트 — 65~70개의 실제 비공개 깃허브 저장소를 사용하여 모델의 에이전트 코딩 능력을 검증함.
- 마케팅 거품 제거 — 인플루언서나 큐레이션된 데모 대신 실제 업무 환경의 버그와 기능 요청을 해결하는 능력을 평가함.
- 다양한 지표 제공 — 평균 비용, 처리 시간, 난이도별 점수, ELO 기반 리더보드 등 상세한 성능 지표를 제공함.
- 진행 중인 업데이트 — Qwen3.7 Max, Deepseek v4 등 미완성된 모델의 테스트를 지속적으로 보완할 예정임.
BIG Apex-Testing update! https://www.apex-testing.org/
The Real-World Agentic Coding 벤치마크가 최근 모델들을 포함하여 (95%) 업데이트되었습니다! 이 벤치마크는 모델의 적절한 에이전트 코딩 능력을 테스트하기 위해 특별히 제작된 65~70개의 실제 비공개 깃허브 저장소를 기반으로 합니다.
이 프로젝트를 처음 접하시는 분들을 위해 웹사이트의 내용을 발췌해 드립니다:
APEX Testing이란 무엇인가?
매주 "역대 최고"라는 새로운 모델이 쏟아져 나옵니다. 모든 제공업체는 비용의 일부만으로 10배의 성능을 보장한다고 광고하죠. 벤치마크는 입맛대로 골라지고, 데모는 큐레이션되며, 인플루언서들은 돈을 받고, 사람들은 계속해서 속아 넘어갑니다.
APEX는 제가 이런 과대광고와 의도적인 벤치마크 조작에 지쳐서 만들었습니다. 모델들을 실제 버그와 기능 요청이 포함된 실제 코드베이스에 투입하여, 개발자가 하듯이 문제를 해결하게 만듭니다. 8개 카테고리에 걸친 70개의 작업은 모두 실제 업무에서 마주칠 법한 일들입니다. 마케팅이 아닌, 실제로 무엇이 작동하는지 확인할 수 있습니다.
현재 지표에 포함된 항목:
-
Avg Cost
-
Avg Time
-
Scoring based off each category/difficulty
-
ELO-based Leaderboard (see details on the website)
-
Model comparison
-
Various metrics (included in the website)
아직 보완이 필요한 몇 가지 사항:
-
Qwen3.7 Max는 현재 실행이 완료되지 않음 (약 40/70 저장소 작업 완료)
-
Qwen3.6 로컬 모델 추가 예정 (BF16으로 며칠 내 추가 예정)
-
Deepseek v4 pro+flash는 현재 실행이 완료되지 않음
-
이상적으로는 Qwen3.5 397B BF16도 추가하고 싶음 (Q4_K_XL은 추가 완료됨)
아마도 이 프로젝트를 위한 기부 창구를 열거나, OpenRouter 토큰을 지원해주실 분이 있다면 감사히 받겠습니다. 그렇지 않다면 앞으로는 모델을 선별적으로 업데이트할 예정입니다(API 비용 문제로, 제 VRAM에 맞는 로컬 모델은 확실히 추가할 것입니다). 부담을 드리려는 의도는 전혀 없으니, 관심 있고 여력이 되시는 분들만 참고해 주세요.

