왜 artificialanalysis.ai는 SciCode에서 Gemma 4를 Qwen 3.6 27b보다 높게 평가할까?
How come artificialanalysis.ai ranks Gemma4 above Qwen3.6 27b in SciCode
핵심 요약
Artificialanalysis.ai의 SciCode 벤치마크 결과가 실제 코딩 체감 성능과 다르다는 의문이 제기되었습니다.
- 벤치마크 신뢰성 — SciCode 평가 결과가 실제 모델 성능과 괴리가 있다는 지적함.
- 모델별 강점 — Qwen은 툴 콜링에, Gemma는 과학 관련 코딩에 강점이 있음.
- 툴 콜링 이슈 — Gemma 4의 툴 콜링 안정성 및 설정 문제에 대한 사용자들의 경험 공유됨.
- 평가 지표 구성 — Intelligence Index v4.1의 가중치와 벤치마크 항목 분석됨.
방금 이 코딩 벤치마크를 발견함: SciCode
Artificialanalysis.ai가 보고한 순위는 우리가 실제 코딩에서 이 모델들에 대해 느끼는 체감과 모순됨.
Gemma 4가 정말 그렇게 좋은 건가, 아니면 벤치마크 문제인가?
수정: Artificialanalysis.ai의 Intelligence index에 대한 이 벤치마크의 기여도:
전체 Intelligence Index v4.1 가중치:
GDPval-AA v2: 20%
Terminal-Bench 2.1: 16%
τ³-Bench Banking: 14%
Humanity's Last Exam: 12%
AA-Omniscience Accuracy: 8%
SciCode: 8%
GPQA: 6%
AA-LCR: 6%
CritPt: 6%
AA-Omniscience Non-Hallucination: 4%
출처: https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-1

