모든 LLM 코딩 벤치마크를 수집하여 '지능 밀도(Intelligence Density)'를 계산해 보았습니다
I collected every single LLM coding benchmark, and computed their Intelligence Density
핵심 요약
다양한 코딩 벤치마크를 종합해 LLM의 파라미터 대비 성능을 나타내는 '지능 밀도' 지표를 제안하고 분석했습니다.
- 지능 밀도 지표 — 파라미터 수와 벤치마크 성능을 결합한 새로운 효율성 측정 방식임
- 데이터 출처 — SWE-bench, DeepSWE, Terminal-Bench 등 검증된 공식 벤치마크 활용
- 파라미터 추정 — 폐쇄형 모델의 파라미터 수를 API 가격을 기반으로 역산하여 추정함
- 모델 효율성 논쟁 — 파라미터 수 외에도 추론 속도, 메모리 점유율, 아키텍처 차이가 중요함
내 컨텍스트에 있는 지능 수치는 내가 Agentic Coding Index라고 이름 붙인 종합 지표야. 가장 관련성 높은 에이전트 코딩 벤치마크들을 죄다 합친 거지. SWE-bench Pro, DeepSWE v1.1, Terminal-Bench (v4, v3, v2.1), Code Arena Elo, 그리고 LiveCodeBench v6가 포함돼 있어.
Intelligence/Parameter=Scale x (Agentic Index / Norm) ^ (Super_Linear_Exponent) / sqrt(PCount + PLowerBound)
-
Norm: 중립적인 기준점 설정 (= 50).
-
Super_Linear_Exponent: 아주 작은 모델들이 점수를 독식하는 걸 막으려고 넣은 비선형 스케일이야(이거 없으면 코딩 흉내만 내는 쪼렙 모델들이 리더보드 상위권을 다 먹어버리거든). 대신 진짜 자율적인 숙련도를 보여주는 모델들한테는 확실하게 보상을 주려고 넣었어. Scale = 2.5354.
-
PCount: 모델 파라미터 수(단위: 10억 개).
-
PLowerBound: 모델 파라미터 최솟값(1B 미만 모델들이 점수 뻥튀기하는 거 막으려고 넣은 정규화 항), =8B.
Agentic Coding Index: DeepSWE v1.1 (20%), Code Arena Elo (20%), Terminal-Bench v4.0 (15%), SWE-bench Pro (15%), Terminal-Bench v3.0 (13%), Terminal-Bench v2.1 (12%), LiveCodeBench v6 (5%).
데이터 무결성: 모든 벤치마크 점수는 검증된 공개 자료와 공식 출처(모델 제작사, 동료 평가 보고서)에서 가져왔음.


