오픈 웨이트 설계력 논쟁
성능 경쟁은 오픈 웨이트로, 신뢰 논쟁은 신원 확인으로 번졌다

이번 주 이야기
GLM-5.2 오픈웨이트 공개, Opus급 설계력 논쟁
Z.ai가 GLM-5.2를 MIT 라이선스로 전면 공개하며 오픈 웨이트 판도를 흔들었다. 코딩 플랜 구독자에게 먼저 풀렸던 모델이 전체 오픈 웨이트로 정식 출시 (출처: GLM-5.2, 텍스트 전용 오픈 웨이트 LLM 중 최강자로 떠오르다)됐고, 750B급 파라미터에 MoE 구조로 활성 파라미터는 40B 수준이다. API와 Ollama 지원 (출처: GLM 5.2 API 출시, 가중치 HF 공개, Ollama 지원 시작)이 동시에 열리며 입력 100만 토큰당 1.4달러, 출력 4.4달러라는 가격이 공개됐다. Terminal-Bench 2.1에서 81.0점을 기록해 기존 오픈 모델 최고 기록 (출처: GLM-5.2, Terminal-Bench에서 80%를 돌파한 최초의 오픈 웨이트 모델로 모든 오픈 모델을 압도)을 넘어섰다는 평가가 나왔다.
Claude Code 하네스 안에서 GLM-5.2가 오퍼스급 설계력을 보인다는 체감이 확산됐다. 한 시니어 개발자는 최대 사고 모드로 테스트한 경험 (출처: Claude Code를 통해 사용해 본 GLM 5.2, Opus와 견줄 만한 첫 비(非) Claude 모델)에서 Opus 4.8과 대등한 수준이었다고 전했지만, 본인도 결정적 벤치마크는 없다고 밝혔다. Vercel CEO의 찬사 (출처: Vercel CEO: GLM-5.2의 코딩 능력에 '거의 충격받았다') 이후 관심이 커졌으나, 다른 스레드에서는 해당 비교가 특정 벤치마크에 편향됐다는 지적 (출처: GLM 5.2 Max, Opus 4.8보다 6배 저렴한 가격에 성능은 더 뛰어남)이 맞섰다. 기본 추론 토큰 소비가 큰 탓에 reasoning_budget 조정이 필요하다는 실측 (출처: GLM 5.2: 토큰 사용량 절반 이하로 최대 지능의 98% 달성)도 함께 나왔다.
확정된 것은 가격·라이선스·벤치마크 수치이고, '오퍼스급'이라는 평가는 여전히 개인 경험담 수준이다. Terminal-Bench 80% 돌파 등은 공식 발표 (출처: GLM-5.2, 텍스트 전용 오픈 웨이트 LLM 중 최강자로 떠오르다)에서 SWE-bench Pro가 GPT-5.5와 대등한 수준이라고 밝혔지만, 실사용 설계력 비교는 커뮤니티에서 아직 검증되지 않았다 (출처: zai-org/GLM-5.2 출시!). GLM-5.2를 Claude Code에 연결해 쓰는 사용자는 늘었지만 산발적인 '써봤다' 수준 보고 (출처: GLM 성능 어떤가요?)에 머물러 있다.
이 흐름대로라면 오픈 웨이트의 가격 대비 성능 우위는 실제 업무 라우팅 전략으로 이어질 수 있다. 다만 '오퍼스급 설계력' 평가는 통계적 근거보다 개별 사용자 체감에 기댄 상태이고, 벤치마크와 실사용 경험의 간극은 다음 벤치마크 공개 때 다시 도마에 오를 여지가 있다.
