ClaudePlaysPokemon Opus 4.7 런 진행 중!
ClaudePlaysPokemon Opus 4.7 run ongoing!
핵심 요약
Anthropic 직원이 개발한 Claude가 포켓몬스터 레드 버전을 플레이하며 Opus 4.7 모델의 성능을 입증하고 있습니다.
- Opus 4.7 성능 — 이전 모델보다 훨씬 빠른 속도로 게임을 진행하며 에이전트 능력의 비약적 발전을 보여줌.
- 벤치마크 가치 — 최소한의 도구와 환경으로 모델의 순수 인지 능력을 테스트하는 중요한 평가 지표로 활용됨.
- 공간 추론 능력 — 복잡한 미로와 지형을 이해하고 경로를 찾는 능력이 모델의 핵심 과제로 부각됨.
- 프로젝트 배경 — Anthropic 직원이 에이전트 개발 학습을 위해 시작했으나 현재는 모델 성능을 측정하는 상징적 프로젝트가 됨.
현재 스트리밍 중: https://www.twitch.tv/claudeplayspokemon
이 프로젝트는 Anthropic의 Applied AI 팀 소속 David Hershey가 진행하는 열정 프로젝트입니다. 그는 에이전트 개발을 배우기 위해 2024년 6월에 시작했고, 내부 Slack에 업데이트를 올리자 동료들이 열광했으며, 2025년 2월 Sonnet 3.7 출시와 함께 공개되었습니다. Anthropic이 소유한 것은 아니지만, Claude 모델을 사용하기 때문에 홍보해주고 API 비용을 지원하고 있습니다.
Claude는 게임 보이 에뮬레이터에서 포켓몬스터 레드 버전을 플레이하고 있습니다. 수정되지 않은 1996년 게임 원본(모델이 화면을 더 잘 볼 수 있도록 팬이 만든 풀 컬러 패치 적용)입니다. 인간의 입력도 없고, 공략집도 없으며, 게임 지식도 주입되지 않았습니다. 시스템 프롬프트는 Claude에게 게임 버전이 자신이 아는 것과 다를 수 있으니 자신의 포켓몬 지식을 신뢰하지 말라고 지시합니다. Claude는 스크린샷, 몇 가지 도구, 그리고 md 노트 파일만 받습니다. 그게 전부입니다.
현재 런은 3주 전에 출시된 새로운 플래그십 모델인 Opus 4.7로 진행 중입니다. 15,779 스텝 만에 8개 배지 중 5개를 획득했고, 파티는 62레벨 이상해꽃이 이끌고 있으며 나머지는 10레벨대입니다(전형적인 스타팅 포켓몬 몰아주기 플레이). 참고로 Opus 4.5는 48,000 스텝 동안 같은 배지 개수에서 실프 주식회사에 갇혀 있었습니다. 4.7은 같은 환경에서 훨씬 빠르게 진행 중이며, 이는 에이전트 환경에서 4.7의 능력 차이를 보여주는 가장 명확한 신호입니다.
스트리밍의 재미있는 부분은 왼쪽의 추론 과정입니다. 지금은 좌표 기반 벽 확인을 통해 미로의 기하학적 구조를 파악하고 있습니다: "(1,8)은 빨간색(벽), (1,9)는 이동 가능, 따라서 (1,8)은 막혀 있음, 하지만 y=8 타일은 모두 빨간색." 실시간으로 공간 논리를 생각하는 과정을 지켜볼 수 있습니다.
간략한 역사. Sonnet 3.5는 주인공 집 밖으로 나가지도 못했습니다. Sonnet 3.7(2025년 2월)은 돌파구였고, 배지 3개를 획득하며 바위 벽에 갇혀 12시간 넘게 달맞이산에서 시간을 보내는 모습으로 화제가 되었습니다. Sonnet 4부터 Sonnet 4.5까지는 스토리 진행이 전혀 없었고, 로켓단 아지트와 민화의 체육관에서 몇 달 동안 멈춰 있었습니다. Opus 4.5(2025년 11월)가 드디어 돌파하여 8개 배지를 모두 얻고 챔피언 로드에 도달했습니다. Opus 4.7은 이제 게임 클리어를 향해 나아가고 있습니다.
벤치마크로서 중요한 이유. 다른 연구소들도 AI 포켓몬 스트림을 운영합니다. Gemini 2.5 Pro는 2025년 5월에 포켓몬스터 블루를 클리어했고, GPT-5는 작년 8월에 더 긴 포켓몬스터 크리스탈을 약 9,500 스텝 만에 클리어했습니다. Claude는 아직 레드를 클리어하지 못했지만, 부분적으로는 Hershey가 환경을 간소하게 유지하기 때문입니다. 세 가지 도구(버튼 입력, 경로 탐색기, 지식 베이스)와 RAM에서 가져온 이동 가능 오버레이, 그리고 노트 파일을 비평하는 두 번째 LLM이 전부입니다. Gemini Plays Pokemon의 환경은 더 복잡합니다. Claude의 런은 스캐폴딩이 하는 일이 적기 때문에 모델의 순수한 인지 능력을 테스트하는 더 순수한 시험이라는 주장이 있습니다.
스트림에서 채팅창에 !harness를 입력하면 에이전트 설정 정보를 볼 수 있습니다.


