Nonobench v1.2: 43개 LLM의 노노그램 퍼즐 성능 테스트. 오픈 웨이트 DeepSeek V4 Pro가 공동 4위, 20x20 하드 모드는 오픈 모델 중 해결 사례 없음
Nonobench v1.2: 43 LLMs on nonogram puzzles. Open-weight DeepSeek V4 Pro ties for 4th, and no open model solves the new 20×20 Hard mode
핵심 요약
43개 LLM을 대상으로 노노그램 퍼즐 성능을 벤치마킹한 결과, 오픈 웨이트 모델이 상위권에 진입했으나 20x20 하드 모드는 여전히 해결하지 못했습니다.
- 벤치마크 업데이트 — 추론 노력 명시 및 모든 프롬프트/출력 공개로 투명성 강화
- 성능 결과 — GPT-6 Astra가 15x15 퍼즐에서 완벽한 성적을 거두며 1위 기록
- 오픈 모델 성과 — DeepSeek V4 Pro가 오픈 웨이트 모델 중 공동 4위 달성
- 하드 모드 한계 — 20x20 하드 모드에서는 아직 어떤 오픈 웨이트 모델도 해결책을 제시하지 못함
지난 1월에 올린 글에 대한 후속 내용이다: https://www.reddit.com/r/LocalLLaMA/comments/1q4i19c/benchmarking_23_llms_on_nonogram_logic_puzzle/. 그 스레드 덕분에 v1.2가 이렇게 바뀌었다:
-
추론 과정(Reasoning effort)을 실행마다 명시함
-
모든 프롬프트와 출력값은 전부 공개함
-
현재 상위권에 있는 비공개 및 오픈 웨이트 모델 전부 추가함
-
누가 Grok이 400자 답변을 제대로 못 세는 걸 발견함. 알고 보니 대부분 모델이 여기서 맛이 가길래, 이제는 텍스트 한 줄로 퉁치는 게 아니라 행 단위로 답변하는 'Hard mode'를 도입함.
결과:
-
GPT-6 Astra: 30/30, 15x15 퍼즐에서 최초로 만점 기록
-
오픈 웨이트 모델 중 최고: DeepSeek V4 Pro 83%(공동 4위), DeepSeek V4.1 Flash는 총비용 $0.84에 77% 기록
-
Hard mode (무작위 20×20 퍼즐 10개, 각 1개 솔루션): Opus 5.5가 8/10. 나머지 오픈 웨이트 모델은 전부 0/10
아직 OpenRouter 전용이라 로컬에서 돌릴 방법은 없음. PR은 언제든 환영.
nonobench.com (원시 데이터, API, GitHub 코드 확인 가능)

