Opus 5.5는 브록 때문에 꼬부기를 골랐고, Fable 5.1은 가장 가까운 볼이라 파이리를 골랐다. 하나는 8달러, 다른 하나는 100달러가 들었다.
Opus 5.5 picked Squirtle because of Brock. Fable 5.1 picked Charmander because it was the closest ball. One cost $8, the other $100.
핵심 요약
AI 모델들이 포켓몬 레드 게임을 플레이하며 보여준 전략적 판단력과 비용 효율성 차이를 비교한 벤치마크 결과.
- 벤치마크 방식 — 포켓몬 레드 게임 내 RAM 데이터를 기반으로 모델의 전략적 의사결정과 비용을 측정함.
- 모델 간 성능 차이 — Opus 5.5는 상성 고려로 효율적인 플레이를 한 반면, Fable 5.1은 비효율적인 선택으로 비용과 시간이 과다 소요됨.
- 전략적 판단 — 모델이 단순히 게임을 깨는 것을 넘어, 목표 달성을 위해 얼마나 영리하게 계획하는지를 평가함.
- 데이터 투명성 — 모든 모델의 턴별 로그와 추론 과정을 공개하여 성능을 검증할 수 있도록 함.
포켓몬스터 레드 새로 시작해서 램(RAM)에서 읽어온 마일스톤으로 점수 매기는 벤치마크 돌려봤다. 모든 모델한테 똑같은 프롬프트 주고, 턴마다 스크린샷 한 장, 게임 상태, 화면에 뜬 글자 보여줌. 길 찾기나 맵 힌트 같은 거 일절 없음. 1,000턴 안에 웅이 깨야 함.
Opus 5.5는 271턴 만에 웅이 잡음. 비용 8.44달러, 1시간 6분 걸렸고, 한 번도 안 짐.
Fable 5.1은 554턴 걸림. 비용 99.76달러, 3시간 17분 걸렸고, 세 번이나 전멸함.
승부는 13턴에서 갈림. Opus는 첫 번째 몬스터볼을 일부러 지나쳤음. 14턴에 내린 판단: "꼬부기 선택. 웅이한테 강하니까." Fable은 그냥 처음 보이는 볼로 가서 "파이리는 좋은 스타팅이지." 이럼. 웅이 생각은 아예 안 함. 파이리는 웅이 바위 타입한테 제일 상성 안 좋은 놈인데.
그래도 Fable이 그 뒤까진 페이스 좋았음. 230턴에 웅이 체육관 들어갔는데, Opus보다 2턴 빨랐음. 근데 체육관 꼬마돌한테 팀 전멸당함. 246턴 전멸 직전 판단: "질 것 같지만 몸통박치기밖에 답이 없다. 전멸하면 포켓몬센터 가서 계획대로 노가다 뛰어야지."
362턴에 똑같은 꼬마돌한테 또 털리고 나서야 계획 바꿈. 363턴: "무지성 돌파가 안 먹히네. 돈도 169달러밖에 안 남음." 22번 도로 가서 망키 잡겠다고 해놓고는 정작 거긴 안 감. 상록숲에서 노가다 뛰다가 511턴에 리자드 진화시키고, 554턴에 돌아가서 웅이 잡음.
모델이 본 프롬프트랑 판단 근거까지 턴 로그 전부 공개함: https://pokebench.tv
수정: 베스트 댓글 내용 정리하자면, 프롬프트에는 그냥 "최종 목표: 게임 클리어"라고만 적혀 있음. 모델들한테 턴 제한이 있다거나 웅이 잡으면 끝난다는 말은 안 함. 일부러 그런 거임. 시키지 않아도 누가 미리 계획 짜는지 보고 싶어서. 다른 프롬프트 테스트해보고 싶으면 하네스 오픈소스니까 가져다 써라. API 키는 알아서 챙기고.


