GLM 5.2: 토큰 사용량 절반 이하로 최대 지능의 98% 달성
GLM 5.2: 98% of max level intelligence with less than half of tokens usage
핵심 요약
GLM 5.2의 과도한 추론 토큰 사용 문제를 해결하기 위해 'high level' 설정을 권장하는 글입니다.
- 추론 토큰 문제 — GLM 5.2의 기본 설정이 너무 많은 토큰을 소모하여 저사양 환경에서 사용이 어려움
- High level 설정 — 최대 수준 대비 절반의 토큰으로도 98%의 지능을 유지할 수 있음
- 로컬 환경 최적화 — llama.cpp의 reasoning_budget 등을 활용해 추론 시간을 제어할 수 있음
- 하드웨어 제약 — 구형 Xeon 시스템 등 저사양 환경에서의 로컬 구동 한계와 최적화 고민
[블록 1/4] 이곳에 따르면 GLM 5.1에서 GLM 5.2로 넘어오면서 추론 토큰 수가 16.7k에서 36.7k로 두 배 이상 증가했습니다. 구형 Xeon 시스템을 사용하는 로컬 사용자 입장에서는 GLM 5.2가 수학 문제에 답을 내놓길 12시간 동안 기다리다가 결국 모델을 꺼야 했을 정도로 사용이 불가능한 수준이었습니다.
[블록 2/4] 그런데 z_ai 기술 보고서에서 이 그래프를 봤습니다. 기본적으로 높은 수준(high level)에서 최대 노력(max effort)의 절반 이하 토큰만 사용해도, 최소한 코딩 작업에서는 최대 지능의 98% 정도를 얻을 수 있다는 내용입니다. GLM 5.2는 기본적으로 'max level'로 설정되어 있으니, 로컬 및 API 사용자 모두 'high level'을 시도해 보길 권장합니다.
[블록 3/4] 업데이트: Q4 양자화로 high level에서 6k 토큰을 돌린 끝에 드디어 수학 문제에 대한 답을 얻었습니다. 괜찮긴 한데, 절반만 맞았네요. 비교하자면 z.ai 채팅의 max level 답변이 훨씬 좋았습니다. Q4 + high level 조합이 이미 너무 과한 건지 모르겠네요.


