왜 SOTA 오픈 웨이트 모델들은 AA-Omniscience Index에서 (상대적으로) 낮은 점수를 받는 걸까?
Why are the SOTA open-weight models scoring (relatively) low scores on AA-Omniscience Index
핵심 요약
오픈 웨이트 모델들이 특정 벤치마크에서 클로즈드 모델보다 낮은 점수를 받는 이유와 벤치마크의 신뢰성에 대해 토론함.
- 벤치마크 포화 — 모델 성능이 상향 평준화되면서 변별력을 위해 벤치마크가 계속 어려워짐.
- 오픈 모델 한계 — 오픈 모델이 지식 저장보다는 코딩이나 추론에 집중되어 있어 지식 기반 벤치마크에서 불리함.
- 마케팅 의혹 — 벤치마크가 클로즈드 모델을 돋보이게 하려는 마케팅 수단이라는 의견이 제기됨.
- 실사용 격차 — 벤치마크 점수와 실제 업무 활용도 사이에는 여전히 큰 차이가 존재함.


