이 주장이 그렇게 터무니없는 건 아닐지도?
Could it be that this take is not too far fetched?
핵심 요약
AI 모델의 성능 저하 의혹과 이를 검증할 지속적인 벤치마크 필요성에 대한 논의.
- 성능 저하 의혹 — 출시 후 시간이 지나면 모델 성능이 떨어진다는 사용자들의 불만 제기됨.
- 지속적 벤치마크 — 모델 제공업체의 조작을 방지할 독립적이고 상시적인 평가 시스템 필요.
- 데이터 편향성 — 성능 저하 체감이 단순히 사용자의 숙련도 향상이나 편향 때문일 가능성 존재.
- 로컬 모델 선호 — 클라우드 모델의 일관성 부족으로 인해 로컬 모델로 회귀하려는 움직임.
Sources:
-
출시 몇 주 후 SOTA 모델들의 성능이 저하된다는 불만이 많음. 비용 절감, 컴퓨팅 자원 부족 등을 추측함...
-
이에 대한 지속적인 벤치마크가 필요하지만, 벤치마크가 너무 유명해지면 AI 제공업체(또는 양자화 및 라우팅 인프라 제공업체)가 벤치마크 계정에만 전체 모델을 제공할 수도 있음.
성능을 추적하는 벤치마크는 딱 두 개 알고 있음(제공업체가 눈치채면 무용지물이 되긴 함):
E: 사소한 해명: 검은 배경의 그래프(시장 3대 경쟁자가 동시에 스스로를 너프하고 있다는 내용)는 내용을 더 읽기 쉽게 하려고 올린 거지, 진지한 데이터 기반 그래프가 아님. 스크린샷만 올리면 너무 작아서 안 보일까 봐 밈처럼 만든 것임. 실제 데이터 기반이라고 생각하지 않음.
