GLM 5.1, 에이전트 벤치마크에서 Opus 제외 모든 모델 압도, 비용은 1/3 수준
GLM 5.1 crushes every other model except Opus in agentic benchmark at about 1/3 of the Opus cost
핵심 요약
GLM 5.1이 에이전트 벤치마크에서 Opus와 대등한 성능을 보이면서 비용은 1/3 수준으로 낮아 가성비가 매우 뛰어남.
- 성능 비교 — GLM 5.1이 에이전트 벤치마크에서 Opus 4.6 수준의 성능을 기록함.
- 비용 효율성 — Opus 대비 1/3 수준의 비용으로 에이전트 작업 수행이 가능함.
- 도구 활용도 — GLM 5.1은 도구를 적극적으로 사용하여 작업당 토큰 사용량이 Opus보다 많음.
- 벤치마크 신뢰도 — 정적 벤치마크 대신 OpenClaw를 활용한 실환경 테스트를 통해 성능을 검증함.
GLM이 벤치마크에만 최적화된 모델인지, 아니면 OpenClaw 같은 에이전트에서 실제로 유용한지 알고 싶어서 우리 에이전트 벤치마크에서 GLM 5.1을 테스트해 봤음.
결과적으로 테스트 기반으로 Opus 4.6 수준의 성능을 내면서 비용은 1/3 수준(~런당 $0.4 vs ~런당 $1.2)임. 테스트한 모든 모델을 능가함. 비용 효율성 측면에서 한계를 상당히 밀어붙였음.
나는 정적 벤치마크를 별로 신뢰하지 않음. 리더보드 순위는 높지만 실제 에이전트 작업에서는 잘 작동하지 않는 모델들을 많이 봤거든. 그래서 우리는 실제 환경 + 실제 작업(사용자 제출)에서 모델의 에이전트 성능을 테스트하기 위해 OpenClaw를 사용함. Chatbot Arena/LMArena 스타일의 배틀이고, LLM이 심판을 보는 방식임.
결과를 바탕으로 말하자면, GLM 5.1은 현재 OpenClaw 유형의 에이전트를 위한 최고의 모델 중 하나임.
Qwen 3.6도 잘했지만, 아직 (OpenRouter에서) 프롬프트 캐싱을 지원하지 않아서 현재 가격이 부풀려져 있음. 프롬프트 캐싱이 지원되면 Minimax m2.7 수준의 런당 비용에 도달해서 가성비 면에서 또 다른 훌륭한 선택지가 될 것으로 예상함.
전체 리더보드, 비용 효율성 분석, 방법론은 https://app.uniclaw.ai/arena?via=reddit 에서 확인할 수 있음. 직접 작업을 제출해서 모델별 성능을 확인해 보는 것을 강력히 추천함.
[Edit 1]
많은 사람들이 토큰당 가격과 작업당 가격을 혼동하는 것 같음.
GLM 5.1의 토큰당 가격은 Opus의 1/5 미만임. 하지만 우리 벤치마크에 따르면 GLM은 같은 작업에서 Opus보다 약 2배 많은 토큰을 사용함. 이유는 GLM이 도구를 공격적으로 사용하기 때문인데, Opus보다 작업당 도구 호출 횟수가 2배 이상 많음. 그래서 실제 작업당 비용이 Opus의 약 1/3 수준인 것임.


