AA 인텔리전스 인덱스 v4.1에서 v4.3으로의 애니메이션 전환
Animated transition from AA Intelligence Index v4.1 to v4.3
핵심 요약
AA 인텔리전스 인덱스의 가중치 변경에 따른 모델별 성능 및 가격 변화를 시각화한 비교 분석입니다.
- 인덱스 가중치 변화 — 모델은 그대로지만 벤치마크 가중치 조정으로 순위가 크게 변동됨.
- 가격 대비 성능 — 모델별 가격과 지능 지수를 선형 그래프로 비교하여 직관적으로 보여줌.
- 주요 모델 변동 — GPT-6 Astra의 성능 급상승과 Sonnet 5의 가성비 하락 등이 관찰됨.
- 데이터 시각화 — 깃허브를 통해 벤치마크 데이터와 플롯 코드를 공개함.

AA v4.1 인덱스 데이터를 전부 저장해 둔 덕분에, Astra 출시 이후 업데이트된 버전이랑 전후 비교를 제대로 뽑아볼 수 있었음.
-
모든 지능 점수와 작업당 가격은 각각 9월 3일과 9월 14일 AA 데이터를 기준으로 함.
-
일부 오픈 모델의 작업당 가격은 9월 3일 기준 OpenRouter에서 가장 저렴한 가격을 반영해 재조정함.
-
X축은 선형(linear)으로 설정함. 돈은 정직하게 선형으로 나가니까.
모델 자체는 똑같음. 바뀐 건 인텔리전스 인덱스를 구성하는 벤치마크들의 가중치 합뿐임.
주요 포인트
-
GLM이랑 Muse Spark는 상대적으로 거의 변한 게 없음.
-
GPT-5.6 Sol은 가격이 훨씬 싸짐.
-
GPT-6 Astra는 지능이 우주 끝까지 떡상했는데 가격까지 저렴해짐.
-
GPT-5.6 Luna는 성능이 확실하게 올라감.
-
Fable-5.1은 Opus 5와의 가격 차이가 줄어들었고, Fable 5.0보다도 싸짐.
-
Fable-5.1은 low, medium, high effort 전부 훨씬 매력적인 선택지가 됨.
-
Sonnet 5는 지능 향상도 없는데 가격만 더 비싸짐.
-
Kimi-K3, Qwen3.8-Max, Gemini-3.8, Grok 4.6은 그냥 나락으로 처박힘.
