GPT-6 Astra, 내 노노그램 벤치마크에서 30개 퍼즐 모두 해결한 첫 모델
GPT-6 Astra is the first model to solve all 30 puzzles in my nonogram benchmark
핵심 요약
GPT-6 Astra가 노노그램 벤치마크에서 모든 표준 퍼즐을 해결하며 뛰어난 논리적 추론 능력을 입증했습니다.
- 벤치마크 성과 — GPT-6 Astra가 30개의 표준 노노그램 퍼즐을 모두 해결함
- 난이도 차이 — 20x20 하드 모드에서는 Claude Opus 5.5가 더 우수한 성능을 보임
- 추론 한계 — 단순 라인 단위 해결은 가능하나 깊은 탐색이 필요한 퍼즐은 여전히 어려움
- 오픈 소스 — 벤치마크 데이터와 결과는 웹사이트를 통해 누구나 확인 가능함
1월부터 노노그램(피크로스 로직 퍼즐)으로 LLM 벤치마크를 돌려보고 있다. 퍼즐당 딱 한 번만 시도했고, 도구는 일절 안 썼으며, 행과 열 힌트를 기준으로 정답을 확인했다.
xhigh 버전의 Astra가 표준 퍼즐 30개(5x5에서 15x15까지)를 전부 푼 첫 번째 모델이다. 1월만 해도 제일 잘하는 모델이 15x15 퍼즐 10개 중 3개밖에 못 풀었었다.
새로 추가된 하드 모드(무작위 20x20 퍼즐 10개)에서는 Astra가 10개 중 5개를 풀었다. 줄 단위로 풀 수 있는 퍼즐 5개는 다 맞혔는데, 더 깊은 탐색이 필요한 나머지 5개는 하나도 못 풀더라. Claude Opus 5.5가 8/10으로 선두를 달리고 있고, 모델 14개 중 11개는 20x20 퍼즐을 하나도 못 풀었다.
더 자세히 파보고 싶으면 아래 링크에서 전부 공개해 놨으니 확인해 봐라: https://www.nonobench.com.
