8개의 LLM을 테이블탑 GM으로 테스트해 봄 - 27B 모델이 405B 모델의 서사 품질을 압도함
I tested 8 LLMs as tabletop GMs - a 27B model beat the 405B on narrative quality
핵심 요약
다양한 LLM을 테이블탑 게임 마스터로 활용해 서사 품질을 비교한 결과, 27B 모델이 가장 뛰어난 몰입감을 보여줌.
- 서사 품질 테스트 — 8개 모델을 대상으로 테이블탑 게임 마스터로서의 몰입감과 서사 능력을 비교함.
- 에이전트 워크플로우 — 단순 챗봇을 넘어 도구 호출을 포함한 복잡한 에이전트 환경에서 모델의 성능을 검증함.
- 로컬 모델 한계 — 24GB 메모리 환경에서 24B 모델은 도구 호출 시 문맥 유지에 어려움을 겪음.
- 성능 비교 결과 — Gemma 3 27B 모델이 분위기, NPC 묘사, GM 역량 면에서 가장 우수한 평가를 받음.
배경:
나는 어떤 LLM에서도 도구 지원을 통해 실행할 수 있는 오픈 소스 에이전트 기반 테이블탑 GM을 개인 프로젝트로 개발 중이다. 처음에는 D&D 세션을 진행하기 위한 Claude Code skill으로 시작했지만, 다양한 백엔드에서 어떤 느낌일지 테스트해보고 싶어 모델과 게임 시스템에 구애받지 않도록 일반화했다. D&D 순수주의자들은 AI 통합 때문에 즉시 비난을 퍼부었지만, 내 목적은 가족들에게 판타지 RPG를 소개하는 것이고 아주 잘 작동하고 있으니 그들의 좁은 식견은 무시했다.
지시 이행 벤치마크와 로컬 모델 테스트에 시간을 보낸 후, 나는 더 흥미로운 질문을 던졌다: 실제로 플레이하고 싶은 서사를 작성하는 모델은 무엇인가? 도구 호출 준수 여부는 기본이다. 나는 어떤 모델이 분위기를 만들어내는지 알고 싶었다.
그래서 나는 서사 품질 프로브를 구축하고 8개의 모델을 대상으로 테스트했다. 그 결과는 다음과 같다.
더 많은 맥락: 에이전트 LLM 도구에 이것이 중요한 이유
open-tabletop-gm은 단순한 챗봇 래퍼라기보다는 에이전트 워크플로우에 가깝다. 모델은 첫 번째 서사 턴을 전달하기 전에 4~6개의 도구 호출(bash, 파일 읽기)을 체인으로 연결해야 한다. /gm load 하나만 해도 오프닝 장면을 보여주기 전에 디스플레이 확인과 3번의 파일 읽기가 필요하다. 여기서 작은 로컬 모델들이 무너지기 시작한다.
나는 MacBook Air(24GB 통합 메모리)에서 Mistral Small 3.1 24B를 작동시키려고 한참을 애썼다. 정말... 대단한 경험이었다. 4~5번의 순차적인 도구 호출 후, 모델의 주의력은 지시 사항에서 가장 최근에 읽은 파일로 쏠렸다. 실제로 모델은 npcs.md를 읽고 "Elara Silvermoon"이라는 NPC를 본 뒤, "Elara Silvermoon"이라는 캠페인을 로드하려고 시도했다. 10개 이상의 지시 변형을 시도했지만, 이건 지시의 문제가 아니라 구조적인 문제였다. 나는 포기했다.
안정적인 로컬 추론을 위한 실질적인 임계값은 64GB 이상의 RAM에서 70B 이상인 것으로 보인다. MacBook Air 하드웨어에서는 OpenRouter가 더 나은 선택이다. 전체 분석을 원한다면 별도의 토론에서 라우팅 아키텍처 변경 사항(상주 프롬프트를 약 87% 감소시킴)을 문서화해 두었다.
서사 프로브
지시 이행 벤치마크가 끝난 후, 나는 서사 품질을 위한 두 번째 프로브를 구축했다. 지시 이행 프로브와 같은 아이디어지만, 질문은 이것이다: 이 모델이 플레이할 가치가 있는 장면을 작성하는가?
이 프로브는 공유 미니 캠페인에 기반한 6개의 GM 시나리오를 각 모델에 보낸다. Cinderpeak라는 화산 아래 Ashmarket이라는 거친 도시를 항해하는 Sable이라는 도적의 이야기다. 모든 모델은 동일한 맥락을 받는다:

