GPT-6 Astra 체스 테스트: Stockfish 1320/1500 설정에서 4승, 1700 설정에서 2패
GPT-6 Astra chess test: 4 wins at Stockfish 1320/1500 limiter settings, 2 losses at 1700
핵심 요약
GPT-6 Astra가 체스 엔진 Stockfish를 상대로 다양한 난이도에서 대국을 펼치며 체스 실력을 검증했습니다.
- 체스 성능 테스트 — Stockfish 18을 상대로 1320/1500 설정에서 전승, 1700 설정에서 전패함
- 실험 방법론 — 외부 도구 없이 FEN 프로토콜만 사용하여 모델의 체스 의사결정 능력을 측정함
- 신뢰성 검증 — 160번의 시도 중 159번의 적법한 응답을 생성하며 높은 안정성을 보임
- 향후 과제 — 기존 벤치마크와의 비교 및 1500~1700 사이의 세밀한 실력 측정 필요

이건 Elo 점수 주장하려고 한 게 아니라, 그냥 간단하게 재현 가능한 실험으로 돌려본 거임.
GPT-6 Astra가 FEN 프로토콜 하에서 Stockfish 18이랑 6판 풀게임을 떴음. Astra한테는 매 턴마다 현재 포지션을 정확하게 줬지만, 체스 엔진, 합법적인 수 목록, 오프닝 북, 테이블베이스, 웹 접속, 코드 실행, 외부 도구 같은 건 일절 안 줬음.
UCI_LimitStrength를 켜고 매 수마다 노드 20만 개로 제한을 건 Stockfish 18을 사용함:
-
1320 리미터 설정: Astra가 2판 다 이김
-
1500 리미터 설정: Astra가 2판 다 이김
-
1700 리미터 설정: Astra가 2판 다 짐
결론은 깔끔함. Astra가 1320이랑 1500 설정에서는 4전 전승, 1700에서는 2전 전패를 박았다는 거임.
아주 중요한 주의사항 하나: 이건 사람 Elo 레이팅이랑은 다름. Stockfish 리미터 1500 설정이 1500점대 사람이랑 두는 거랑 똑같은 게 아니고, 6판 가지고는 공식 레이팅을 추정하는 게 택도 없음.
첨부된 영상은 1700 설정에서 둔 게임 중 하나를 처음부터 끝까지 보여줌. Astra가 한때 +4.22까지 앞서가다가 서서히 우위를 헌납하고 결정적인 실수를 저지르면서 결국 Stockfish가 역전승을 거둠.
따로 사전 등록된 신뢰도 테스트도 여러 RAW 및 FEN 조건에서 돌려봤음. Astra는 160번 중 159번이나 합법적이고 제대로 된 응답을 내놨음. 실패가 딱 한 번뿐이라 어떤 조건이 더 신뢰도가 높다고 말할 근거가 부족해서, 데이터를 과하게 해석하지 않으려고 거기서 멈췄음.
분명히 짚고 넘어갈 주의사항이 하나 더 있는데, 이 실험은 매 턴 FEN을 제공했기 때문에 현재 포지션에서 체스 의사결정을 내리는 능력만 테스트한 거임. Astra가 도움 없이 전체 보드를 기억했다는 걸 보여주는 건 아님.
PGN, 프롬프트, 모델 원본 응답, 연구 결과물, 방법론, 고정된 벤치마크 스냅샷을 포함한 모든 자료는 검증할 수 있게 공개해 뒀음:
https://github.com/socialplayai/blunder-zero-ai-chess-benchmark
분석이랑 시각화는 내가 만들고 있는 체스 분석 프로젝트인 Blunder Zero로 진행했음. 실험 자체가 핵심이라 앱스토어 링크나 다운로드 홍보는 일부러 뺐음.
다음에는 어떤 진지한 테스트를 해보면 좋을지 다들 어떻게 생각하는지 궁금함.

