Terminal Bench v4 점수
Terminal Bench v4 scores
핵심 요약
새로운 Terminal Bench v4 벤치마크 결과가 공개되었으며, 모델 지능을 측정하는 방식에 대해 커뮤니티 내 논쟁이 뜨겁습니다.
- 벤치마크 신뢰도 — 모델 지능을 측정하는 새로운 지표로서의 타당성을 두고 의견이 갈림
- 모델 순위 — GLM-5.3 시리즈가 상위권을 차지한 반면 일부 유명 모델은 낮은 점수를 기록함
- 데이터 오염 의혹 — 벤치마크 데이터가 공개되어 있어 최신 모델에 유리할 수 있다는 비판 제기
- 현실성 논란 — 벤치마크 점수가 실제 모델 성능과 괴리되어 있다는 지적과 벤치마크의 우수성을 옹호하는 의견이 대립함
터미널 벤치마크가 인텔리전트 인덱스보다 모델 지능을 더 잘 보여준다는 말이 있더라. 딱 보니까 순위가 사람들이 오픈 모델이랑 클로즈드 모델에 대해 느끼는 체감이랑 얼추 맞는 것 같네.
오픈 모델 쪽은 GLM-5.3이 그냥 압도적임. GLM-5.3-Flash는 요즘 나오는 플래시 모델들 중에서 대장 먹고 있고. Kimi-K3는 덩치에 비해 이번 벤치마크에서 성적이 영 별로네. Qwen3.8-27B는 이 벤치에서 그나마 비벼볼 만한 유일한 소형 모델인 듯.
| Model | Score |
|---|---|
| GLM-5.3 | 41.9% |
| GLM-5.3-Flash | 32.8% |
| DSV4.1-Flash | 26.8% |
| Qwen3.8-Flash-Next | 25.3% |
| DSV4-Pro | 14.1% |
| Kimi-K3 | 12.6% |
| DSV4-Flash | 12.1% |
| Qwen3.8-27B | 5.6% |
| Muse Glimmer | 0.5% |
| gemma4-31b | 0.0% |

