Claude Code를 통해 사용해 본 GLM 5.2, Opus와 견줄 만한 첫 비(非) Claude 모델
GLM 5.2 via Claude Code is the first non-Claude model that feels close to Opus
핵심 요약
GLM 5.2가 Claude Opus급의 코딩 및 설계 능력을 보여주며, 오픈 소스 모델이 상위 티어 모델을 위협하고 있다는 평가가 나옵니다.
- 성능 비교 — GLM 5.2가 생각 모드 '최대' 설정 시 Claude Opus 4.8과 대등한 수준을 보여줌
- 설계 능력 — 단순 코딩을 넘어 아키텍처 설계와 트레이드오프 판단이 가능한 수준임
- 시장 경쟁 — 미국 정책 환경이 자국 모델의 우위를 지키기 어려운 상황에서 오픈 소스 모델이 빠르게 추격 중
- 실제 활용 — 데이터베이스, 백엔드, 프론트엔드 등 다양한 개발 워크플로우에서 실질적인 유용성 확인
GLM 5.2를 Anthropic 호환 API 엔드포인트를 통해 Claude Code와 함께 사용해 보고 있어. 데이터베이스 개발, 백엔드 결제 API 작업, 백엔드 및 프론트엔드 디버깅, Laravel 웹 개발, React 프론트엔드 작업 등 다양한 프로젝트에서 테스트를 마쳤지.
처음으로 자신 있게 말할 수 있는 건, 내 경험상 생각 모드를 "max"로 설정했을 때 "extra-high" 추론을 사용하는 Opus 4.8과 대등한 수준으로 보인다는 거야.
물론 이건 주관적인 경험일 뿐이고 내 주장을 뒷받침할 결정적인 벤치마크는 없어. 하지만 나는 Claude Max 구독을 3개나 사용 중인 시니어 개발자야. 나는 Claude를 정말 좋아하고 많이 사용하며, Anthropic을 깎아내리거나 Claude를 대체하려는 의도는 전혀 없어.
나는 Claude Code 하네스를 사용하여 DeepSeek V4 Pro(지난 몇 달간 20억 토큰 이상 사용) 같은 다른 모델들도 사용해. 구체적으로 말하자면, 나는 보통 DeepSeek를 구현 도구로 사용하며 그 제한적인 역할 내에서는 유용하다고 느꼈어. 대략 Sonnet 4.6 정도와 비교할 수 있겠지. 하지만 GLM 5.2는 Claude의 최고 수준 코딩 능력과 계획/사양 초안 작성 능력 등에 근접했다고 진심으로 느낀 첫 번째 모델이야.
Anthropic 팬보이들에게 비추천 폭탄을 맞기 전에 미리 말하자면, 앞서 언급했듯이 이건 주관적인 경험이야. 또한 이 모델이 중국산이라는 명백한 이슈가 있는데, 이는 데이터 민감성 및 기타 관련 문제와 관련하여 그 자체로 또 다른 논의가 필요한 부분이지.
이 글의 요점은 단순히 사용자들에게 이제 Claude 수준의 유용성에 근접하거나 때로는 도달하는 오픈 소스 또는 저비용 모델들이 존재할 수 있다는 사실을 알리는 거야. 그리고 현재 미국의 정책 환경(Fable)은 자국 모델들이 외국 경쟁사들보다 편안하게 앞서 나가는 데 별로 도움이 되지 않고 있어.
