Sonnet 5.5와 GPT 6.1 Sol의 MCP를 통한 체스 대결 기록 및 사용량 분석
I let Sonnet 5.5 play a full chess game against GPT 6.1 Sol over MCP. Here's the recording and usage.
핵심 요약
Claude Sonnet 5.5와 GPT 6.1 Sol의 체스 대결을 통해 모델별 토큰 효율성과 성능 차이를 비교 분석함.
- 모델 성능 비교 — Sonnet 5.5와 GPT 6.1 Sol의 체스 실력과 토큰 소모량을 실시간으로 측정함.
- 토큰 효율성 차이 — Sonnet이 추론 과정에서 훨씬 많은 토큰을 사용하는 반면 Sol은 매우 효율적인 모습을 보임.
- 체스 대결 결과 — 두 모델 모두 체스 규칙을 이해하고 대국을 진행했으나, 일부 실수와 비합리적인 기권이 발생함.
- 비용 및 사용량 — 구독료 대비 토큰 사용량 차이가 큼을 확인하고 향후 추가 테스트를 계획함.

Sonnet은 자기 폰 승진을 두고 "막을 수 없다"고 큰소리쳤지만, 몇 수 지나지도 않아서 방어 수단을 놓쳤다고 바로 꼬리를 내렸다. 설명 옆에 체스판을 띄워놨으니 뻔히 보이는 실수를 모른 척할 수도 없었겠지.
Claude Desktop의 Sonnet 5.5와 Codex의 GPT 6.1 Sol을 붙여서 체스 경기를 시켜봤다. 각자 대화창 하나씩 잡고, GPT 6.1 Sol이 Medium 추론 단계에서 직접 짠 로컬 Mac 앱을 MCP로 연결해서 진행했다.
둘 다 자기 계획을 기록하고 수를 설명하게 했다. 앱은 현재 판 상황만 알려주고 수의 적법성만 체크할 뿐, 체스 엔진이나 가능한 수 목록 같은 건 일절 제공하지 않았다. 한 시간 동안 끈기 있게 붙들고 있다가 계획이 틀어지면 어떻게 반응하는지 보고 싶었거든.
토큰 소모량도 궁금했다. 요즘 Sol이 내 구독 한도를 거의 안 잡아먹길래, 같은 작업을 시켰을 때 Sonnet이랑 얼마나 차이 나는지 비교해 보려고 했다.
첨부한 영상은 62분 47초짜리 경기를 4분 10초로 압축한 거다. 두 모델 다 Medium 설정으로 돌렸다.
| Measure | Sonnet 5.5 / Claude | GPT 6.1 Sol / Codex |
|---|---|---|
| Time spent on claimed turns | 33m 45s | 21m 12s |
| Output tokens, including reasoning | 269,076 | 34,956 |
| Thinking/reasoning portion of output | 224,770 | 12,128 |
| Cumulative input tokens | 57.44M | 16.81M |
| Input read from cache | 99.07% | 98.95% |
| Rejected illegal moves | 1 | 0 |
| Estimated API equivalent | $16.21 | $2.37 |
Sonnet은 통과한 폰을 승진시키려고 밀어붙였지만, Codex의 Bf3 방어를 못 보고 지나쳤다. 나중에는 자기 폰에 막힌 퀸 이동을 하겠다고 우기다가 서버한테 퇴짜 맞고, Claude가 부랴부랴 수를 수정해서 게임을 이어갔다. Codex도 초반에 폰 하나를 통과한 폰으로 착각해서 헛소리한 적이 있다.
결국 53.Qc4 이후 Claude가 기권했다. 1차전은 Claude가 이겼으니 1대 1 무승부다.
표 뒤에 숨겨진 세부 사항 좀 풀자면, 턴 시간은 서버가 업데이트된 판을 보여주기 전부터 측정했고 도구 사용 시간도 포함했다. 런타임이 턴을 가져가길 기다리는 시간은 따로 쟀다. 토큰 총합은 설정이랑 마무리까지 포함한 전체 대화 내용 기준이고, 모니터링 과정은 뺐다. 캐시된 컨텍스트는 요청마다 다시 계산했다. 사고 과정(Thinking)은 출력값에 포함되어 있는데, 제공업체마다 계산 방식이 달라서 참고만 해라. API 비용은 9월 30일 가격 기준으로 계산했고, 이번 게임 자체로 발생한 API 비용은 없다.

