GLM 5.2 찬양하는 놈들은 다 중국 봇들인가?
Are the GLM 5.2 glazers all Chinese bots?
핵심 요약
GLM 5.2를 직접 테스트해 본 작성자가 성능과 토큰 효율성에 실망하며, 이를 띄워주는 여론이 봇 때문인지 의문을 제기함.
- 성능 비교 — GPT 5.5와 GLM 5.2를 비교한 결과 GLM 5.2가 더 나은 점이 없었음
- 토큰 효율성 — GLM 5.2는 동일 작업 대비 50~100배 많은 토큰을 소모함
- 모델 증류 의혹 — 중국 모델들이 frontier 모델의 행동을 흉내 내는 증류 모델 같다는 의견
- 사용자 반응 — GLM 5.2가 Opus 4.6~4.7 수준이라며 비용 효율성 면에서 대체 가능하다는 반론도 존재함
[블록 1/3] 5.1 버전이 나온 이후로 코딩 작업에 GPT 모델을 써왔고, Claude 1.2 때부터는 Claude 코드를 복사해서 붙여넣기 해왔음. Anthropic이나 OpenAI가 가끔 저지르는 어처구니없는 짓들 말고는 큰 문제는 없었음. 레딧 전역에서 이 모델이 미친 듯이 과장 광고되길래, 'Mr. Gippity(GPT)'의 굴레에서 벗어날 수 있을까 싶어서 새로 나온 GLM 5.2를 제대로 써봤음. GitHub 이슈랑 UI/UX 관련 고민거리들을 GPT 5.5 high랑 Neuralwatt로 돌린 GLM 5.2(총 2억 토큰 정도)에 넣어봤는데, 두 모델 다 거의 모든 문제를 해결할 수 있었지만 GLM 5.2가 더 잘한 적은 단 한 번도 없었음. 오히려 "잠깐, 사실은..."이라며 삽질의 늪에 빠지는 바람에 사고의 연쇄(chain of thought)를 다시 시작해야 했던 적이 한두 번이 아님. 코드는 지나치게 장황했고, 응답마다 텍스트 폭탄을 날리지 말라고 했는데도 '간결하게(terse)'라는 단어의 의미를 전혀 이해하지 못하는 게 분명했음. 파라미터까지 조정해 봤지만 소용없었음.
[블록 2/3] 게다가 GLM 5.2는 같은 작업을 완료하는 데 GPT보다 50~100배 많은 토큰을 소모하는 경우가 허다했음. 토큰당 가격이 싸면 뭐 함, 다 태워버리는데? 작은 작업에는 비용 효율성이 엄청나게 유용할 수도 있겠지만, 낮은 사고 설정에서도 토큰 소모량이 너무 터무니없음.
[블록 3/3] 중국 모델들이 전부 frontier 모델들의 행동을 흉내 내는 것처럼 느껴지는데, 이건 극단적인 수준의 증류가 이루어졌다는 증거임. 나만 이렇게 생각하는 건지, 아니면 내가 이상한 건지 궁금함.


