GLM-5.1이 SWE-Bench Pro에서 Claude Opus 4.6과 GPT-5.4를 이겼다고 주장하는데, 왜 회의적인가.
GLM-5.1 allegedly beat Claude Opus 4.6 and GPT-5.4 on SWE-Bench Pro. Why I'm skeptical.
핵심 요약
GLM-5.1의 벤치마크 성능 수치에 대한 신뢰성과 실제 배포 환경에서의 비교 타당성에 의문을 제기함.
- 벤치마크 신뢰성 — SWE-Bench Pro의 평가 방식이 실제 버그 해결 능력을 완벽히 반영하지 못함.
- 비용 비교 논란 — MoE 모델과 dense 모델의 아키텍처 차이로 인해 단순 파라미터 비교는 부적절함.
- 라이선스 중요성 — MIT 라이선스 채택이 기업의 데이터 보안 및 배포 환경에 더 큰 영향을 미침.
- 실제 성능 검증 — 벤치마크 수치보다 실제 프로덕션 환경에서의 성능 검증이 필요함.
GLM-5.1이 지난주에 출시됨 — 744B 파라미터, MIT 라이선스, 포워드 패스당 40B 활성 파라미터, 200K 컨텍스트. 헤드라인은 SWE-Bench Pro에서 Claude Opus 4.6과 GPT-5.4를 모두 이겼다는 것임. 상당히 큰 주장임.
내가 SWE-Bench Pro에 대해 가진 문제점: 평가 방법론이 매우 중요함. "모델이 GitHub 이슈를 해결했다"와 "모델이 테스트 스위트를 통과하는 출력을 생성했다" 사이에는 큰 차이가 있음. 오픈 소스 저장소의 테스트 스위트에는 빈틈이 있음. 기존 테스트를 통과하는 그럴듯해 보이는 diff를 생성하도록 학습된 모델은 실제로 버그를 이해한 모델과 같지 않음.
또한, 40B 활성 파라미터를 가진 744B MoE 모델은 배포 비용 면에서 100B dense 모델과 비교할 수 없음. "40B 활성 파라미터"라는 프레이밍은 라우팅 오버헤드, 200K 컨텍스트에서의 KV 캐시 크기, 희소 전문가 활성화 시의 콜드 스타트 동작을 과소평가하는 것임. 추론 수학은 단순하지 않음.
이게 GLM-5.1이 나쁘다는 뜻은 아님; 로컬에서 실행해 본 사람들의 초기 수치는 다양한 작업에서 확실히 강력해 보임. 하지만 아키텍처가 다른 모델들을 단일 평가 세트에서 벤치마크 비교하는 것은 근거가 약함. 나는 고정된 테스트 세트의 큐레이팅된 GitHub 이슈가 아니라 실제 프로덕션 작업 분포에서 보고 싶음.
MIT 라이선스가 실제로 중요한 부분임. 그것은 벤치마크 수치가 보여주지 못하는 방식으로 데이터 상주 요구 사항이 있는 기업들의 배포 계산을 바꿔놓음.

