jevman: 팩맨을 플레이하는 AI 의사결정 모델들
jevman: AI decision models play Pac-Man
핵심 요약
AI 의사결정 모델들의 성능을 비교하기 위해 팩맨 게임을 활용한 벤치마크 프로젝트가 공개됨.
- 벤치마크 프로젝트 — 6개의 주요 AI 의사결정 모델을 팩맨 게임으로 테스트함.
- 성능 리더보드 — 모델별 평균 점수와 지연 시간을 측정하여 순위를 공개함.
- 오픈소스 공개 — 누구나 자신의 모델을 벤치마크에 추가할 수 있도록 함.
- 대화형 체험 — 사용자가 직접 팩맨이 되어 AI 모델들과 대결할 수 있음.

저번 주에 Jev랑 Kev 비교한 글 올렸었는데, 그 이후로 OpenAI가 decisions 엔드포인트 내놓고, Cloudflare는 Clef를, 그리고 여기저기서 Laya에 대해서도 많이들 물어보더라고.
이번에는 팩맨 게임을 시켜서 인기 있는 의사결정 모델 6개를 비교해 봤어: kev 1.13, Kev 4B, Clef, Clef Flash, GPT-6 Luna, 그리고 Laya.
이것들 반응 속도가 ms 단위라 실시간으로 게임 돌리는 게 가능하더라고.
리더보드도 공개했고 레포도 오픈소스니까, 직접 파인튜닝한 모델이나 어디 호스팅해 둔 모델 같은 거 돌려보고 싶은 사람은 누구든 참여해서 리더보드에 이름 올리면 돼.
| Model | Avg score | High score | Avg latency |
|---|---|---|---|
| jev 1.13 | 2,750 | 6,380 | 290 ms |
| GPT-6 Luna | 2,568 | 5,920 | 179 ms |
| Clef Flash | 2,538 | 4,260 | 256 ms |
| Clef | 2,476 | 4,820 | 398 ms |
| Kev 4B | 1,506 | 5,280 | 231 ms |
| Laya | 639 | 1,200 | 104 ms |
리더보드 순위는 모델마다 100번씩 돌려서 95% 오차 범위(±표준 오차 2배) 내의 평균 점수로 매겼어. 그래서 몇몇 모델은 공동 1위야.
직접 팩맨이 돼서 플레이해 볼 수도 있는데, 이때 유령들은 전부 jev, clef, Luna, Laya 중 하나로 설정하거나, 유령마다 모델을 섞어서 플레이하는 것도 가능해.
