Bomberman 스타일 1v1 게임에서 Claude vs GPT 대결
Claude vs GPT in a bomberman-style 1v1 game
핵심 요약
LLM의 전략적 추론 능력을 테스트하기 위해 두 모델이 대결하는 Bomberman 스타일의 오픈소스 게임을 개발함.
- 전략적 실시간 대결 — 속도와 추론 품질 사이의 균형을 맞추도록 설계됨.
- 텍스트 기반 환경 — 시각적 입력 대신 게임 상태를 텍스트로 변환하여 모델이 처리하게 함.
- 오픈소스 프로젝트 — GitHub를 통해 누구나 코드를 확인하고 참여할 수 있음.
몇 주 전, ARC-AGI 3가 출시되었습니다. 잘 모르시는 분들을 위해 설명하자면, 이는 상호작용 환경을 통해 에이전트 지능을 연구하기 위해 설계된 벤치마크입니다.
저는 이런 종류의 벤치마크를 매우 좋아합니다. 제 생각에는 정적인 Q&A 벤치마크보다 에이전트 AI의 능력과 한계에 대해 훨씬 더 많은 것을 보여주기 때문입니다. 또한 모델이 이러한 환경에서 어떻게 행동하는지 실제로 볼 수 있을 때 훨씬 직관적으로 이해할 수 있습니다.
저는 그런 정신을 살리면서도 두 LLM을 서로 맞붙게 하는 환경을 만들고 싶었습니다. 제 기준은 다음과 같았습니다:
- 전략적 & 실시간. 게임은 속도와 추론 품질 사이에서 진정한 상충 관계를 만들어야 했습니다. 더 작은 모델은 더 많은 움직임을 보일 수 있지만 전략은 부족하고, 더 큰 모델은 더 느리지만 더 똑똑하게 움직입니다.
- 좋은 하네스. 저는 의도적으로 시각적 입력을 피했습니다. 모델들은 여전히 너무 느리고 시각적 입력에 대해 충분히 정확하지 않기 때문입니다(Claude가 포켓몬을 플레이하는 것을 참고하세요). 대신, 하네스가 게임 상태를 구조화된 텍스트로 변환하고, 게임 엔진이 에이전트의 응답을 유동적인 애니메이션으로 렌더링합니다.
- 보는 재미. 벤치마크가 꼭 지루할 필요는 없으니까요 :)
최종 결과물은 두 에이전트가 벽돌을 부수고 서로에게 폭탄을 던지며 경쟁하는 Bomberman 스타일의 1v1 게임입니다.
오픈소스는 여기에서 확인할 수 있습니다: github
여러분의 의견을 듣고 싶습니다!



