Artificial Analysis에서 Opus 5.5가 58점을 기록했는데, 오픈 모델이 58점에 도달하려면 얼마나 걸릴까요?
Now Opus 5.5 is 58 on Artificial Analysis , how long do you have wait until an open model hits 58?
핵심 요약
Artificial Analysis의 벤치마크 신뢰성에 대한 의구심과 함께 오픈 소스 모델의 발전 속도를 논의합니다.
- 벤치마크 신뢰성 — Artificial Analysis의 평가 방식이 편향되어 있다는 비판이 제기됨
- 오픈 소스 발전 — 모델 성능 향상 속도에 대한 기대와 회의적인 시각이 공존함
- 모델 성능 논란 — 특정 모델의 실제 사용 경험이 벤치마크 점수와 다르다는 의견이 있음
- 폐쇄성 강화 — 기업들이 모델의 개방성을 줄이고 증류를 막으려는 움직임에 대한 우려
최고 오픈 모델인 mimo 2.6 pro보다 12점이나 높고, fable 5.1이랑 비교하면 엄청난 도약임. 미친 거 아니냐? glm 5.5랑 qwen 4는 점수가 48점이나 되니까 gpt 6 sol이랑 비슷하거나 더 나을 듯.
최고 오픈 모델이 44점에서 46점까지 올라가는 데 2달 걸렸는데, 이 속도면 6달 뒤에는 58점 찍는 거 아님? GPU 더 때려 박고 파라미터, 데이터, 연산량 늘리면서 아키텍처까지 개선하면 지능이 더 퀀텀 점프할 테니까 4~5달 안에도 충분히 가능할 듯. 와, 근데 sol 6가 deepswe에서는 5.6보다 구린 거 실화냐?

