Artificial Analysis의 '지능 지수'에 대한 내 생각
My issue with Artificial Analysis's 'intelligence index'
핵심 요약
Artificial Analysis가 오픈 소스 모델의 순위를 낮추기 위해 벤치마크 가중치를 조작했다는 의혹이 제기되었습니다.
- 벤치마크 조작 의혹 — 오픈 소스 모델의 순위를 낮추기 위해 가중치를 임의로 변경했다는 주장이 제기됨.
- 용어 사용 논란 — 'unbiased(편향되지 않은)'를 'bipartisan(초당파적인)'으로 잘못 사용하는 것에 대한 조롱.
- 실무 성능 중시 — 벤치마크 점수보다 실제 작업에서의 성능과 가성비가 더 중요하다는 의견이 지배적임.
- 커뮤니티 불신 — 벤치마크 결과에 대한 맹신과 특정 모델을 옹호하는 봇 및 마케팅 활동에 대한 경계.
AA가 그들이 주장하는 만큼 초당파적이지 않다고 확신함. 오픈 소스 모델(Qwen 3.8 max)이 에이전트 지수에서 1위를 차지했는데, 그들이 갑자기 인덱스 "v4.1.1"을 출시하면서 gdpval과 t3 뱅킹의 가중치를 조정해버림. t3에서 8% 앞서고 있었는데도 opus보다 낮게 나오게 만들었고, opus는 gdpval에서 5% 앞설 뿐인데 말이지. 내 생각엔 돈을 받은 게 거의 확실함. 변경 전후의 점수는 다른 서브레딧에서 확인할 수 있는데, 그냥 오픈 소스 모델이 지고 Anthropic이 계속 1위를 유지하도록 만든 것뿐임.


