GLM 5.1, 내 사회적 추론 벤치마크에서 최상위 모델들과 어깨를 나란히 하다
GLM 5.1 sits alongside frontier models in my social reasoning benchmark
핵심 요약
GLM 5.1이 복잡한 사회적 추론 게임에서 Claude Opus와 대등한 성능을 훨씬 저렴한 비용으로 보여줌.
- 벤치마크 성능 — 복잡한 사회적 추론 게임인 Blood on the Clocktower에서 최상위 모델들과 경쟁함.
- 비용 효율성 — Claude Opus 대비 약 1/4 수준의 비용으로 동일한 수준의 게임 플레이가 가능함.
- 도구 사용 정확도 — 0%의 도구 오류율을 기록하며 매우 안정적인 성능을 입증함.
- 모델 평가 — 최신 모델들의 추론 능력을 게임 환경에서 객관적으로 비교 분석함.
아직 신뢰할 만한 데이터를 얻으려면 더 많은 매치가 필요하지만, GLM 5.1은 다른 최첨단 모델들과 매우 경쟁력 있어 보임.
이 벤치마크는 LLM들을 서로 대결시키는 방식으로, 복잡한 사회적 추론 게임인 Blood on the Clocktower를 자율적으로 플레이하게 함. 마지막 스크린샷은 GLM 5.1이 악당 팀(빨간색)으로 플레이하는 모습임.
비교하자면,
Claude Opus 4.6은 게임당 $3.69.
GLM 5.1은 게임당 $0.92.
도구 오류율은 0%.
매우 인상적임.

