문명 5를 플레이하는 LLM 벤치마크: GLM-5.3이 Opus-5.5를 앞서고, Qwen-3.8-27B도 놀라운 성능을 보여줌
A benchmark for LLMs playing Civilization V. GLM-5.3 is ahead of Opus-5.5, and Qwen-3.8-27B holds up surprisingly well.
핵심 요약
LLM이 문명 5를 플레이하며 전략적 의사결정을 수행하는 벤치마크 프로젝트를 소개하고 모델별 성능을 공유함.
- CivBench 벤치마크 — LLM이 문명 5의 장기적 전략을 수립하는 능력을 테스트함
- 모델별 성능 — GLM-5.3이 Opus-5.5를 제치고 Qwen-3.8-27B도 준수한 성적을 기록함
- 제어된 실험 — 동일한 초기 조건에서 LLM이 전략을 짜고 기존 AI가 실행하는 방식임
- 오픈 소스 프로젝트 — 사용자가 직접 LLM과 문명 5를 플레이하거나 AI 대 AI 경기를 관전 가능함
얼마 전에 여기서 OSS-120B랑 GLM-4.6으로 문명 5 풀 게임 돌리는 거 올렸었지. 그 이후로 모델 성능이 꽤 많이 올라와서, 모델들이 게임을 얼마나 잘하는지 제대로 파악해보고 싶더라고.
새로운 모델들로 돌려본 통제된 버전의 CivBench를 소개한다:
통제된 버전의 CivBench (Chen et al., 2026, 우리 COLM 2026 연구 확장판)
지금 GPT-6.1-Sol, GPT-6-Astra 같은 모델들 테스트 중이야. 다음번에 돌려볼 만한 모델(특히 흥미로운 오픈 웨이트 모델) 있으면 추천 좀 해줘!
문명이 뭔데? 문명 5(지금 스팀 할인해서 7.49달러임)는 턴제 전략 게임인데, 문명을 선택해서 수백 턴 동안 확장하고, 과학 발전시키고, 외교하고, 전쟁하면서 결국 우주 시대까지 가는 게임이야. 이게 왜 좋냐면, LLM 벤치마크들이 맨날 골머리 앓는 '결과가 50~100턴 뒤에 나타나는 의사결정'을 테스트하기 딱 좋거든.
비잔틴 제국을 플레이하는 LLM 전략가. 테오도라가 로마를 재건할 수 있을까?
왜 통제된 실험이냐고? 모델마다 제각각 다른 게임을 시키는 게 아니라, 을 돌려가면서 테스트하거든. 게임마다 문명 8개가 들어가는데, 그중 2개는 테스트할 LLM 전략가가 잡고, 나머지 6개는 기본 Vox Populi AI가 돌려. LLM은 큰 그림(전략)을 짜고, 세부적인 실행은 문명 자체 AI가 맡는 방식이지.






