딥러닝의 진정한 능력을 보여주는 최신 코딩 벤치마크들
Coding benchmarks that are quickly showcasing deep capability
핵심 요약
기존 벤치마크를 넘어 소프트웨어 엔지니어링의 깊은 이해도를 측정하는 새로운 벤치마크들을 소개합니다.
- Program-Bench — 바이너리 분석을 통해 코드베이스를 재구축하는 능력을 평가함
- SRE-Bench — 소스 코드 없이 바이너리 파일의 동작을 역공학적으로 분석함
- Code Migration — 언어 간 프로그램 재구현 능력을 측정함
- 벤치마크 신뢰성 — 모델 성능 측정 방식과 데이터의 정확성에 대한 논의가 이루어짐
DeepSWE, Terminal-Bench, LiveCodeBench, Code-Arena ELO 같은 유명 코딩 벤치마크에서 프론티어 모델들이 죄다 비슷한 점수를 찍고 있긴 한데, 내 생각에 진짜 심층 지능이랑 소프트웨어 엔지니어링의 완벽한 역량을 제대로 보여주는 다음 단계 벤치마크들은 따로 있음.
1. Program-Bench
컴파일된 바이너리랑 문서만 던져주고, 디컴파일러나 인터넷 접속 없이 원래 프로그램이랑 똑같이 작동하는 코드베이스를 처음부터 끝까지 설계하고 구현해야 함. 링크: https://programbench.com/
-
GPT-6 Astra: 5.5%
-
Fable 5.1: 7%
-
Kimi K3: 2%
-
Qwen3.8 27b: 0%
-
GPT 5.6 Sol: 1.5%
-
GLM 5.3: 1.5%
-
GPT 5.6 Luna: 0%
2. SRE-Bench
AI 에이전트가 소스 코드 없이 실제 바이너리가 무슨 짓을 하는지 파악할 수 있을까?
링크: https://www.vals.ai/benchmarks/srebench
뭐 평소에 어셈블리 코드 읽는 사람이 어딨겠냐, 존나 어렵지. 근데 컴파일된 프로그램을 이해한다는 건 진짜 미친 능력임.
-
GPT-6 Astra: 88%
-
GPT-5.6 Sol: 55.9%
-
Claude Opus 5 (max): 12.5%
3. Code Migration
언어 모델이 돌아가는 프로그램을 다른 언어로 다시 구현할 수 있을까?
링크: https://www.vals.ai/benchmarks/code-migration
-
GPT-6 Astra: 67.7%
-
Fable 5.1: 54.6%
-
GLM 5.3: 44.2%
-
GLM 5.3 Flash: 20.5%
-
Qwen3.8 27b: 14.2%
수정: 텍스트 형식 수정함


