Terminal Bench 4.0 출시, 오차 범위를 고려하면 GLM-5.3은 Fable 5와 동급
Terminal Bench 4.0 just dropped, GLM-5.3 is at the same level as Fable 5, accounting for margin of error
핵심 요약
Terminal Bench 4.0이 공개되었으며, GLM-5.3이 Fable 5와 대등한 성능을 보인다는 결과에 대해 벤치마크 신뢰성과 모델 성능을 두고 활발한 논의가 이어짐.
- 벤치마크 신뢰성 — GLM-5.3과 Fable 5의 성능 비교 결과에 대한 통계적 해석과 의구심 제기됨.
- 데이터 오염 의혹 — 벤치마크 순위가 경제적 가치가 커지면서 모델이 벤치마크 데이터를 미리 학습했을 가능성 제기됨.
- 실제 사용 경험 — 벤치마크 점수와 달리 실제 코딩 작업에서는 모델별 성능 체감이 다르다는 의견 공유됨.
- 비용 효율성 — 대규모 벤치마크 실행의 높은 비용 문제와 소규모 대안에 대한 고민 공유됨.
공지사항: https://www.tbench.ai/news/terminal-bench-4-0
리더보드: https://www.tbench.ai/
개인적으로 이번 발표에서 제일 마음에 드는 건, 벤치마크 점수 인플레이션 막으려고 새로운 모델 나올 때마다 TerminalBench를 빠르게 업데이트해서 대응하겠다는 점임.
비슷한 맥락에서, 코딩 에이전트나 본인이 직접 만든 하네스(harness)를 벤치마킹할 때 쓸만한 더 저렴하고 가벼운 대안은 없을까? 이런 대규모 벤치마크는 토큰을 50억~100억 개씩 처먹는데, 우리 같은 일반인이 감당하기엔 비용이나 연산 자원 면에서 말이 안 되잖아.
내 스킬이나 하네스, 도구 같은 걸 바꿨을 때 일반적인 코딩 작업에서 토큰 사용량이나 성공 확률이 어떻게 변하는지 객관적으로 측정하고 싶거든. 매번 수십억 토큰씩 안 써도 대략적인 방향성이라도 잡을 수 있는 방법이 분명히 있을 텐데 말이야.

