LLM들이 실제 물리 엔진으로 검술 대결을 펼치는 아레나를 만들었습니다. 칼날의 어느 부분이 날카로운지 직접 정하고, 블라인드 투표로 OpenRouter 모델들의 Elo 점수를 겨뤄보세요. 현재 Llama 3.3이 GPT-OSS의 얼굴을 찌르고 있네요.
I built an arena where LLMs sword-fight with real physics. You decide which part of the blade is sharp, vote blind, and free OpenRouter models battle for Elo. Llama 3.3 is currently stabbing GPT-OSS in the face.
핵심 요약
LLM이 물리 기반 래그돌 캐릭터를 조종해 검술 대결을 펼치는 독특한 AI 아레나 프로젝트입니다.
- 물리 기반 대결 — LLM이 HP와 거리 등 상태를 파악해 동작과 풋워크를 결정함
- 무기 규칙 설정 — 칼날의 위험 구역을 직접 지정해 펜싱이나 난투 등 전략 유도
- 다양한 모델 지원 — Llama 3.3, Qwen3 등 무료 모델로 비용 없이 대결 가능
- 오픈 소스 프로젝트 — 100% 무료 티어에서 호스팅 가능하며 전략 리포트도 제공됨
Chatbot Arena와 비슷하지만, 텍스트 뭉치를 비교하는 대신 두 모델이 물리 엔진이 적용된 래그돌 캐릭터를 조종해 무기 대결을 펼칩니다. 무기 규칙은 여러분이 설정할 수 있습니다.
작동 방식:
- 매 턴마다 두 LLM은 JSON 형태로 전투 상태(HP, 거리, 적의 마지막 행동, 지난 턴의 피격 부위)를 전달받고 행동과 풋워크를 선택합니다.
- 물리 엔진이 이를 실행합니다: 운동량, 관절 제한, 무기 구역 × 충격 속도에 따른 충돌 데미지 등이 계산됩니다. "살아있는" 구역으로 헤드샷을 날리면 즉사합니다.
- 반전 요소: 어떤 구역이 위험한지 여러분이 선택합니다. 칼끝만 위험하게 설정하면 펜싱을 강제하게 되고, 칼자루 끝만 설정하면 클린치 난투가 벌어집니다. 플레일 스파이크는 높은 속도에서만 데미지가 들어가므로 모델이 미리 예비 동작 턴을 계획해야 합니다. 규칙은 시스템 프롬프트에 들어가며, 전략은 모델의 몫입니다.
- 블라인드 투표(파이터 A/B)를 진행하며, 이름과 Elo 점수는 투표 후에 공개됩니다. 규칙별 리더보드도 있습니다.
스크린샷은 실제 경기 장면입니다. 파란색 모델이 "타격 범위 진입. 날카로운 구역으로 머리를 노려라"라고 선언한 뒤, 다음 턴에 정확히 그 공격을 받아버렸습니다.
무료 모델들(Llama 3.3 70B, GPT-OSS, Qwen3, Nemotron, Gemma)이 로스터에 포함되어 있어 비용 없이 경기를 돌려볼 수 있으며, 원하는 OpenRouter ID를 붙여넣을 수도 있습니다. LLM이 10개의 관절을 직접 제어하는 Toribash 스타일의 "관절 모드"도 있습니다. 현재 모델들은... 몸을 제대로 가누지 못합니다. 아주 훌륭하죠.
100% 무료 티어(HF Spaces + Vercel + Supabase)에서 직접 호스팅할 수 있습니다. 토너먼트 모드는 공격성 %, 모델이 실제로 날카로운 구역을 사용했는지 여부, 매치업별 선호 동작 등을 포함한 전략 리포트를 생성합니다.
(첫 경기는 HF Space가 깨어나는 데 1분 정도 걸릴 수 있습니다.)
