GLM 5.2 개인 벤치마크 결과: Fable, Opus 4.8, GPT 5.5와 대등한 수준
GLM 5.2 personal benchmark. Results comparable with Fable, Opus 4.8, and GPT 5.5
핵심 요약
GLM 5.2 모델의 코딩 성능을 다양한 지표로 테스트한 결과, 최상위 모델들과 대등한 성능을 보였습니다.
- 벤치마크 방식 — 동일한 웹 앱 과제를 여러 AI 모델이 수행하고 자동화 테스트 및 AI 심사위원으로 평가함
- 평가 지표 — 웹 서비스, 데이터 저장, 캐싱, 로그 기록, UI 구현, 안정성 등 다각도로 품질 측정
- 성능 결과 — GLM 5.2가 Fable, Opus 4.8, GPT 5.5와 유사한 높은 점수를 기록함
- 추론 비용 — GLM 5.2는 이전 모델 대비 추론 로그가 10배 증가하는 등 더 깊은 사고 과정을 거침
모든 모델한테 똑같은 지시사항을 줬음. 상세한 스펙 하나를 주고 작지만 완벽한 웹 앱을 만들게 한 다음, 똑같은 방식으로 채점하는 거임. 이 과제는 일부러 여러 분야를 한꺼번에 건드리게 설계했으니까, 높은 점수를 받으려면 이 모든 게 유기적으로 돌아가야 함.
- 웹 서비스 — 요청을 받고 정확한 응답을 반환할 것.
- 데이터 저장 — 정보를 저장하고 필요할 때 제대로 불러올 것.
- 캐시 — 최근 결과는 재사용하고 데이터가 바뀌면 갱신할 것.
- 활동 로그 — 무슨 일이 일어났는지 정해진 형식대로 기록할 것.
- 웹 페이지 — 브라우저에서 실제로 돌아가는 인터페이스를 만들 것.
- 신뢰성 및 안전성 — 요청이 몰려도 잘 버티고, 흔한 보안 구멍은 다 막을 것.
채점은 자동화된 테스트랑 별도의 AI 심사위원들이 진행함. 점수는 높을수록 좋음.
표 보는 법
- Implementer — 코드를 짠 AI 모델.
- Helper — 시도 중간중간 코드를 검토하고 피드백을 준 보조 AI 모델.
- Evaluator — 이번 실행의 코드 품질을 채점한 AI 모델.
- Gate — 실행 종료를 결정한 기준. 세 가지 종류가 있음:
- completion-cmd — Stops as soon as the automated tests pass; the helper only steps in if they fail.
- completion-cmd-advisory — Tests must pass and the helper-reviewer must also approve before it stops.
- promise — No tests; the helper-reviewer alone decides when the work is done.
- Iters — 코드 작성 후 검토를 몇 번 반복했는지.
- Walltime — 실행에 걸린 시간(분 단위).
- Score — 최종 품질 점수(90점 만점, 높을수록 좋음).
실행 설정
모든 실행은 동일한 하네스 설정을 따름:
- 동일 과제 — 모든 모델이 똑같은 상세 스펙을 바탕으로 똑같은 앱을 만듦.
- 최대 라운드 — 작성 후 검토 과정을 최대 5번까지 반복 (Gate에 따라 더 빨리 끝날 수도 있음).
- 호출당 시간 제한 — 모델 호출당 최대 약 90분, 그래서 느리고 복잡한 추론이 필요한 모델도 끝까지 마칠 수 있음.
- 라운드 간 대기 시간 — 10초.
- 재시도 — 호출당 최대 3번까지; 3번 연속 실패하면 실행 중단.
- 채점 — 4명의 독립적인 AI 심사위원이 최종 코드를 90점 만점으로 채점; 표에는 그중 가장 낮은(가장 엄격한) 점수를 표시함.

