AI 모델들이 로봇 두뇌를 코딩해서 서로 싸우게 만드는 작은 아레나를 만들었습니다
I built a small arena where AI models write robot brains and then fight each other
핵심 요약
AI 모델이 작성한 코드로 로봇을 구동해 성능을 겨루는 오픈소스 프로젝트 'llms-robot-arena'를 소개합니다.
- 로봇 아레나 — AI 모델이 작성한 코드로 로봇의 전략을 결정하여 대결함
- 동일 조건 — 모든 로봇은 물리적으로 동일하며 오직 코딩된 전략만으로 승부함
- 모델 비교 — 벤치마크 표 대신 실제 행동 양식을 통해 모델의 추론 능력을 비교함
- 오픈소스 프로젝트 — 누구나 웹에서 대결을 관전하거나 코드를 확인할 수 있음
llms-robot-arena라는 소규모 오픈소스 실험을 하나 만들고 있어.
아이디어는 꽤 간단해.
서로 다른 AI 코딩 모델들한테 똑같은 규칙을 주고, 각자 로봇의 두뇌를 짜게 한 다음에 로봇끼리 맞붙게 하는 거지.
AI가 실시간으로 로봇을 조종하는 건 아니야. 먼저 코드를 다 짜놓으면, 그 코드를 바탕으로 경기가 진행되는 방식이지.
로봇들 스펙은 다 똑같으니까, 결국 모델이 어떤 전략을 짜느냐에 따라 승패가 갈리는 거야.
로봇들은 언제 공격할지, 언제 뺄지, 에너지는 어떻게 아낄지, 충전 구역은 어떻게 활용할지, 구덩이나 위험한 타일은 어떻게 피할지, 그리고 시간이 갈수록 험악해지는 경기장에서 어떻게 살아남을지 스스로 판단해야 해.
재밌는 건 똑같은 규칙을 줘도 모델마다 행동 패턴이 확연하게 다르다는 거야.
어떤 놈은 공격적으로 나가고, 어떤 놈은 몸 사리고, 어떤 놈은 위치 선정 기가 막히게 하는데, 또 어떤 놈은 진짜 말도 안 되는 짓만 골라서 하더라고.
경기는 재현 가능하니까, 같은 봇에 같은 시드값이면 항상 똑같은 결과가 나와.
라이브 버전은 여기서 볼 수 있어:
https://nigrosimone.github.io/llms-robot-arena/
프로젝트는 오픈소스니까 확인해 봐:
https://github.com/nigrosimone/llms-robot-arena
아직 규칙을 다듬는 중이긴 한데, 핵심은 뻔한 벤치마크 표 보는 것보다 AI 성능 비교를 좀 더 재밌게 해보자는 거야.
다들 어떻게 생각할지 궁금하네. 이런 방식이 코딩이나 추론 모델 성능 비교하는 데 흥미로운 방법이라고 봐?

