DeepSeek V4.1 Flash, AA의 새로운 벤치마크에서 Astra를 앞지르다
DeepSeek V4.1 Flash beats Astra on AA's new benchmark
핵심 요약
AA의 새로운 벤치마크에서 DeepSeek V4.1 Flash가 1위를 차지했으나, 환각 문제와 벤치마크 신뢰성에 대한 논란이 이어지고 있습니다.
- 벤치마크 업데이트 — AA가 Intelligence Index v4.3을 통해 새로운 비공개 평가 방식을 도입함.
- 성능 순위 변동 — DeepSeek V4.1 Flash가 Astra를 제치고 1위에 오르며 새로운 강자로 등극함.
- 환각 현상 우려 — 높은 성능과 함께 환각 비율도 높다는 지적이 제기됨.
- 평가 신뢰성 논란 — 도구 사용 환경과 모델의 실제 성능 간 괴리에 대한 의문이 제기됨.
https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3
AA가 지난주 Intelligence Index v4.3 업데이트의 일환으로 새로운 벤치마크를 내놨음. τ³를 대체하는 완전히 새로운 비공개 평가 방식임. Astra가 거기서 점수를 엄청나게 쓸어 담으면서 Fable이랑 동급까지 따라잡았는데… 보아하니 새로운 왕이 등장한 모양임.
그러니까 Astra가 Fable보다 아주 형편없어 보이진 않게 하려고 3일 동안 지수를 두 번이나 바꿨는데, 정작 웬 듣보잡이 조용히 1위를 차지해 버렸네.


