Artificial Analysis의 'Intelligence' 지표: 의미 없는 벤치마크
Artificial Analysis "Intelligence": A meaningless benchmark
핵심 요약
Artificial Analysis의 벤치마크 점수가 LLM 성능을 제대로 반영하지 못한다는 비판과 함께 지표의 신뢰성에 대한 논쟁이 벌어짐.
- 벤치마크 신뢰성 — Artificial Analysis의 지표가 모델의 실제 성능을 왜곡한다는 비판이 제기됨.
- 모델 비교 논쟁 — 파라미터 수와 벤치마크 점수 간의 상관관계를 두고 사용자들 간 의견이 갈림.
- 평가 방식의 한계 — 에이전트 작업에 치우친 벤치마크가 범용적인 지능을 측정하지 못한다는 지적.
- 대안 부재 — 현재 LLM 성능을 완벽하게 측정할 표준화된 벤치마크가 없다는 현실적 한계.
오늘 누가 Qwen 3.8 27B 벤치마크를 올렸던데, Qwen 27B가 진짜 강력한 모델인 건 맞거든? 근데 Artificial Analysis 이딴 벤치마크가 얼마나 의미 없는지 도저히 그냥 넘어갈 수가 없네. 도대체 왜 아직도 이런 쓰레기 같은 자료를 퍼 나르면서 AA 점수를 LLM 비교할 때 무슨 성경마냥 떠받드는지 이해가 안 감.
걔네 "Intelligence Index" 보면 27B 모델이 이제 DeepSeek v4 Flash랑 Pro, Kimi 2.7 Code, GPT-5.2, Opus 4.6, 심지어 Sonnet 5까지 다 바른다고 나옴. 이쯤 되면 물어봐야지. 도대체 이 지표가 뭘 측정하는 거냐? AA랑 걔네 뒤에 있는 기업형 VC, 기자, 그리고 일반인들이 생각하는 "지능"의 정의는 우리가 여기서 다루는 거랑은 완전히 다른 게 확실함.
Qwen 27B는 훌륭하고 GPU 하나에 올릴 수 있는 모델 중에서는 확실히 독보적인 위치에 있는 거 맞음. 근데 Qwen 27B를 두고 "사실상 3개월 전 Opus를 노트북에서 돌리는 거랑 똑같음" 이런 식으로 글 올라오는 거 볼 때마다 진짜 눈이 돌아가서 참을 수가 없다.
모델 성능을 숫자 하나로 요약하기 어려운 거 알고, 우리 로컬 모델 좋아하는 마음도 이해하는데, 이제 그만 좀 하자. AA의 명백한 개쓰레기 벤치마크 들고 와서 뭐라도 증명된 것처럼 구는 꼴 좀 그만 보고 싶음.



