8개 로컬 모델을 대상으로 한 중세 유럽 판타지 RP/에이전트 벤치마크 결과: Qwen3.6-27B의 선전
Ran a classic(medival europe) fantasy RP/agentic benchmark across 8 local models Qwen3.6-27B held up better than its size suggests
핵심 요약
로컬 모델 8종의 판타지 RP 및 에이전트 성능을 벤치마크한 결과, Gemma-4-31B와 Qwen3.6-27B가 우수한 성적을 거뒀습니다.
- 벤치마크 구성 — 퀘스트 완료, 시간 추적, 캐릭터 감지 등 에이전트 성능 평가
- 모델별 성적 — Gemma-4-31B(87%)와 Qwen3.6-27B(82%)가 상위권 기록
- 세부 점수 불균형 — 전체 점수는 높지만 특정 카테고리에서 성능이 급락하는 현상 발견
- 평가 방식 — 외부 LLM을 활용한 자동 채점 방식으로 진행
벤치마크 스위트(퀘스트 완료, 장면 마무리, 아이템/시간 추적, 캐릭터 감지, 스토리텔링, 초안 작성)를 급하게 만들어서 여기 사람들이 자주 언급하는 8개 모델을 돌려봤어. 외부 LLM 채점기를 사용해서 평가했고, 카테고리별 N값은 차트에 표시된 대로 달라.
전체 통과율은 gemma-4-31B가 87%로 1위, Qwen3.6-27B가 82%로 그 뒤를 바짝 쫓고 있어. 그 후 gemma-4-12B(80%)까지는 괜찮다가 더 작거나 느슨한 모델들은 55~70% 범위로 점수가 꽤 급격하게 떨어져. 뭐, 예상했던 결과긴 해.
나한테 흥미로웠던 부분은 1위가 누구냐가 아니라 세부 점수가 얼마나 불균형한지였어. 어떤 모델들은 "퀘스트 완료"는 잘하는데 "NPC 생각"이나 "퀘스트 요약"에서는 완전히 무너져버리거든. 전체 %만 보면 절대 드러나지 않는 부분이지. 다른 사람들도 자기 평가에서 이런 카테고리별 성능 절벽을 본 적 있는지 궁금하네.
