Gemma4와 Qwen3.6으로 원 나이트 웨어울프 게임하기
Playing One Night Werewolf (Gemma4 & Qwen3.6)
핵심 요약
llama.cpp를 활용해 여러 LLM이 서로 대화하며 '원 나이트 웨어울프' 게임을 진행하도록 구현한 실험기입니다.
- LLM 게임 시뮬레이션 — llama.cpp를 통해 여러 모델이 비공개 메모와 공개 채팅을 오가며 게임을 진행함.
- 모델별 역할 수행 — 각 모델에 역할을 부여하고 턴마다 자신의 메모를 읽고 기록하게 하여 추리 과정을 구현함.
- 모델 성능 비교 — Gemma4와 Qwen3.6 모델별로 거짓말 실력, 도구 사용 능력, 사고력의 차이를 확인함.
- 커뮤니티 피드백 — 게임에 적합한 다른 모델 추천과 함께 흥미로운 게임 로그 공유를 요청받음.
드디어 가능할 것 같다는 느낌이 드네요. llama.cpp에서 모델을 자유롭게 전환할 수 있는 커스텀 빌드 UI를 만들었습니다. 그래서 Gemma4 31B Q4, Gemma4 26B Q5, Qwen3.6 27B Q5, Qwen3.6 35B Q4를 모두 모아서 '원 나이트 웨어울프(ONUW)' 게임을 시켜보기로 했습니다.
Qwen 모델들이 공개 채팅에서 생각하는 내용을 떠들지 않도록 '생각하기(thinking)' 기능을 꺼야 했습니다.
먼저 밤 시간에 각 LLM에게 카드(늑대인간, 예언자, 마을 사람, 말썽꾸러기)를 하나씩 할당했습니다. 각자 자기 카드를 읽고, 다른 모델이 볼 수 없도록 각자의 메모장에 관찰 내용과 생각을 적게 했습니다. 낮이 되면 게임 채팅방으로 불러내어 각 턴마다 자신의 메모를 읽고, 방어하거나 질문을 던지게 했습니다. 8~10턴 동안 관찰 내용을 기록한 뒤, 투표를 위해 최종 생각을 적게 했습니다. 투표는 다시 개인 채팅으로 돌아가서 진행했고요.
Gemma4 31B — 거짓말을 제일 잘함. 메모에 생각이 가장 명확하게 정리됨.
Gemma4 26B — 도구 사용을 못 함. 생각은 빠르지만 깊이가 없음.
Qwen3.6 35B — 자기가 마을 사람인 줄 알고 대담하게 행동하다가 당함. 도구 호출 능력은 최고.
Qwen3.6 27B — '생각하기'를 끄니까 별로 똑똑하지 않음. 너무 느림…
LLM을 활용하는 아주 생산적인 방법은 아니라는 거 압니다… 게임에 추가할 만한 다른 모델 있을까요? 추천 부탁드립니다.

