Artificial Analysis는 '고장'난 게 아님, 그들이 증명하고 있음
Artificial Analysis is not "broken", and they prove it.
핵심 요약
Artificial Analysis의 벤치마크 신뢰성 논란에 대해, 개별 평가와 방법론을 이해해야 한다는 옹호 의견과 지표의 자의성을 비판하는 의견이 대립함.
- 벤치마크 신뢰성 — 개별 평가와 방법론을 확인하면 지표의 의미를 파악할 수 있음
- 지표의 자의성 — 가중치 설정이 주관적이라 종합 점수는 무의미하다는 비판 존재
- 지속적 조정 — 모델 성능 변화에 따른 벤치마크 재설정이 신뢰도를 떨어뜨린다는 지적
- 독립적 검증 — 광고 없이 자체 자금으로 운영되는 벤치마크의 가치를 인정해야 함
너희들 중 많은 사람처럼, 나도 지난 몇 주 동안 Artificial Analysis가 "망가졌다", "의미 없다", "매수당했다"면서 징징대는 글이랑 트윗을 엄청나게 많이 봤다. 이런 소리 하는 놈들은 제대로 찾아보지도 않았고, 벤치마크가 어떻게 돌아가는지, 뭘 측정하는지도 쥐뿔도 모르는 애들임.
대부분은 Artificial Analysis Intelligence Index에만 관심이 있지. 이건 모델 10개의 성능을 비교하려고 가중치를 둬서 합산한 벤치마크야. 이 평가들 대부분은 arxiv.org에 논문이 올라와 있어. AA-Briefcase만 유일하게 비공개 벤치마크고, 얘네는 각 모델에 가중치를 어떻게 매기는지 방법론까지 다 공개해 놨음.
Artificial Analysis가 광고도 안 돌리고 자기들 돈 써가면서 독자적으로 벤치마크 돌리는 걸 고마운 줄 모르는 놈들이 좀 있는 것 같네. 여기 보면 얘네가 돈 얼마나 쓰는지 차트가 나와. Fable 5.1 하나 독자적으로 테스트하는 데만 13,129달러를 썼어. 새로 나오는 모델마다 다 벤치마크 돌리는 것 같던데.
새로 나온 Deepseek V4.1-Flash가 왜 합산 점수만 보면 전체적인 그림을 놓치게 되는지 보여주는 완벽한 예시야. 이 552B 모델은 180B짜리 Qwen 3.8-Flash-Next랑 점수(40)가 똑같아. 근데 개별 벤치마크를 뜯어보면 이야기가 다르지. 대부분 평가에서 Qwen 3.8-Flash-Next랑 비슷하거나 더 잘해. 심지어 AutomationBench-AA(에이전트 SaaS 워크플로우)에서는 GPT-6 Astra (Max)까지 이겨버리는데, 이건 진짜 대단한 거거든. 근데 AA-Omniscience Non-Hallucination Rate에서는 완전히 밀려버려. 보통 오픈 웨이트 모델들이 씹어먹는 지표인데 말이야. 그러니까 이 모델은 장단점이 확실한 거고, 이건 칭찬받아 마땅한 부분이지.
그러니까 벤치마크나 Artificial Analysis 욕하기 전에, 개별 평가 항목들을 좀 봐. 평가 관련해서 발표된 논문들을 읽어. . 그러고 나서 대화를 하자고.


