GPT-6 Astra의 ARC AGI-3 98.6% 점수에 관하여: 과대광고에 속지 마세요
On GPT-6 Astra 98.6% ARC AGI-3: don't fall for the hype
핵심 요약
OpenAI의 ARC AGI-3 벤치마크 결과가 독자적인 하네스 사용으로 인해 과대평가되었다는 비판과 논쟁.
- 벤치마크 신뢰성 — 독자적인 하네스 사용이 결과의 객관성을 해친다는 지적함
- 비교의 공정성 — 표준 하네스 대신 커스텀 도구를 사용하는 것은 경주에 슈퍼바이크를 허용하는 것과 같음
- 기술적 맥락 — NVIDIA 등 다른 사례에서도 이미 100% 달성 사례가 존재함
- AGI 회의론 — 벤치마크 점수가 AGI 도래를 증명하는 것은 아니라는 의견이 지배적임
Here is the news you may have missed:
Nvidia already demonstrated 100% on ARC AGI-3, using their novel harness AVO:
OpenAI didn't use the standard harness in the ARC AGI-3, but their own.


