코딩 에이전트에서 Claude Opus를 GLM-5.2로 교체해 보았습니다
We swapped Claude Opus for GLM-5.2 in our coding agent
핵심 요약
코딩 에이전트 환경에서 Claude Opus와 GLM-5.2의 성능을 비교한 결과, 동일한 해결률과 실패 유형을 보였으나 비용 면에서 GLM이 더 효율적이었습니다.
- 성능 비교 — 45개 작업 중 두 모델 모두 25개를 해결하며 동일한 품질을 기록함
- 실패 유형 — 두 모델 모두 잘못된 결과를 확신하며 정답이라고 주장하는 동일한 오류를 보임
- 비용 효율성 — GLM-5.2가 Opus 대비 약 46% 수준의 비용으로 동일한 결과를 도출함
- 한계점 — 45개라는 제한된 작업 수와 모델의 비결정론적 특성으로 인해 추가 검증이 필요함
[블록 1/6] 오픈 웨이트 모델이 실제로 최첨단 코딩 에이전트 작업을 수행할 수 있는지 확인하고 싶었습니다. 그래서 GLM-5.2를 Claude Opus와 정면으로 비교했습니다. 정적 평가가 아닌, 실제 터미널 환경에서 Claude Code라는 코딩 에이전트를 구동하고 각 작업의 숨겨진 테스트를 통해 평가하는 방식으로 진행했습니다. 모델이 판단하는 방식이 아닌, 이진 통과/실패(Binary pass/fail) 방식을 사용했고 부분 점수는 없었습니다.
[블록 2/6] 두 실행 모두 동일한 에이전트, 프롬프트, 도구, 40턴 예산, 45개 작업을 사용했습니다. 유일하게 바뀐 것은 각 턴에서 응답하는 모델뿐이었습니다.
[블록 3/6] 결과는 다음과 같습니다:
[블록 4/6] - 동일한 품질: 두 모델 모두 45개 작업 중 정확히 25개를 해결했습니다.
- 동일한 답변: 45개 중 43개에 대해 의견이 일치했습니다(24개는 둘 다 성공, 19개는 둘 다 실패). 나머지 2개는 각각 하나씩 해결했습니다. 어느 한 모델이 체계적으로 더 강력한 카테고리는 없었습니다.
- 동일한 실패 모드: 두 모델 모두 숨겨진 테스트에서 거부된 작업에 대해 "수정 완료 / 모든 테스트 통과 / 검증됨"이라고 선언하며 자신 있게 틀리는 실패 방식을 보였습니다. GLM의 모든 실패 기록이 그렇게 끝났고, Opus도 동일한 형태를 보였습니다.
- 비용: 프롬프트 캐싱을 적용했을 때, GLM은 동일한 결과에 대해 Opus 비용의 약 46% 수준($15 vs $32.67)을 기록했습니다. 캐싱을 하지 않았을 때도 이미 약 10% 더 저렴했습니다.
[블록 5/6] 명확히 밝혀둘 주의 사항: 45개 작업은 의미가 있지만 유한하며, 모델은 비결정론적이므로 25=25라는 결과보다는 45개 중 43개가 일치했다는 점에 주목하고 있습니다. 또한 GLM은 두 모델 중 토큰 효율성이 떨어져서 동일한 답변에 도달하기 위해 약 37% 더 많은 턴(760 vs 554)을 사용했습니다. 이 점 때문에 비용 격차가 더 커지지 않은 것입니다. 또한 초기 "GLM 실패" 중 일부는 모델 문제가 아니라 업스트림 502/429 속도 제한 문제로 밝혀져 제외해야 했습니다. 이는 제공자 API를 통해 오픈 모델을 벤치마킹하는 분들이 참고할 만한 사항입니다.
[블록 6/6] 턴 분포, 토큰 분석, 실패 기록 전문을 포함한 전체 내용은 여기에서 확인하세요: https://entelligence.ai/blogs/glm-5-2-vs-claude-opus-coding-benchmark

