Evalatro: LLM이 실제 Balatro를 플레이하는 오픈 벤치마크
Evalatro: an open benchmark where LLMs play the real Balatro
핵심 요약
LLM이 실제 Balatro 게임을 플레이하며 성능을 겨루는 오픈 벤치마크 'Evalatro'가 공개되었습니다.
- 벤치마크 목적 — LLM이 실제 Balatro 게임을 플레이하며 Ante 12까지 도달하는지 측정함.
- 기술적 구현 — Steamodded와 balatrobot을 활용해 게임 상태를 텍스트로 받아 의사결정함.
- 공개 리더보드 — 모든 실행 결과는 서버에서 계산되어 조작이 불가능하며 대시보드에 기록됨.
- 커뮤니티 피드백 — Ante 12라는 난이도 설정과 벤치마크의 공정성에 대한 논의가 진행됨.
안녕! 내가 Evalatro를 만들었어. LLM이 직접 Balatro를 플레이하는 오픈 벤치마크야. 진짜 게임이라고.
내가 게임 하다가 레벨 깨기 힘들어서(맞아, 나 좀 허접함) Claude한테 계속 도와달라고 스크린샷 던지면서 전략 물어보던 게 시작이었어.
그러다 일이 좀 커져서 제대로 파보기로 했지.
제대로 파봤지...
처음엔 모드로 MCP를 만들어보려 했는데, 이미 balatrobot이라는 게 있더라고(제작자 리스펙). 그렇게 시작된 거야.
모델이 게임에 접속해서 매 턴마다 텍스트 구조로 된 게임 상태를 받아와. 사진이 아니라 텍스트로. 그리고 지가 알아서 뭘 낼지 결정함. 힌트 같은 거 없음.
지금 구현된 기능들:
- 재현성을 위해 시드 고정 — 모든 모델이 똑같은 패를 받음
- 실제 Balatro + Steamodded + balatrobot 사용
- 실시간 뷰어랑 공개 리더보드 제공
- 런 끝나면 결과가 공개 대시보드로 전송됨(개인정보는 싹 다 뺌. 키나 경로 같은 거 없음, 소스도 오픈)
- 점수는 클라이언트가 아니라 서버에서 계산하니까 조작 불가능
- 벤치마크 목표는 Ante 12 클리어(그냥 대충 정했는데, 의견 있으면 말해줘). 기본 게임 Ante 8 깨는 거랑은 차원이 다름
- 윈도우/macOS 자동 설치 지원
- 모델이 왜 그런 선택을 했는지 추론 과정을 볼 수 있음(이게 진짜 웃김)이랑 모든 런 리플레이 가능
- 런 시작 전에 모든 게 언락된 별도 게임 프로필을 생성해서 모델이 제약 없이 플레이함(니 본계정 세이브는 건드리지 않음)
아직 모델 몇 개만 살짝 돌려본 거라 순위라기보단 그냥 간 보는 중이야. 근데 벌써 웃김. 아무도 Ante 12 근처도 못 감. 1등인 mimo-v2.5-pro가 겨우 Ante 5까지 기어 올라갔어. deepseek-v4-pro도 있었는데 걔는 Ante 8 보스도 못 깨더라. 리더보드 업데이트하면서 결과 날려먹긴 했지만. 아무튼 도전 과제는 활짝 열려 있으니까 와서 모델들이 고통받는 거 구경해.
Balatro 고수들이랑 LLM 쪽 사람들 피드백 좀 받고 싶어. Ante 12가 적당한 기준일까, 아니면 너무 오버인가? "도달했냐 못 했냐" 말고 또 측정할 만한 게 있을까? 벤치마크 부정행위 못 하게 하려면 구멍을 어떻게 막아야 할까? 내가 벤치마크 만드는 건 영 초짜라 말이야.
추신. 깃허브에 별 하나씩만 박아주면 진짜 엎드려 절할게!
링크:
Github: https://github.com/alesha-pro/evalatro
Public Dashboard: evalatro.dev


