오픈 모델들 덕분에 Sonnet 비교가 훨씬 덜 우스꽝스러워짐.
Open models are making Sonnet comparisons a lot less ridiculous.
핵심 요약
1,000개의 코딩 에이전트 시나리오를 벤치마크한 결과, GLM 5.2와 MiniMax M3가 Sonnet 4.6과 대등한 성능을 보임.
- 벤치마크 결과 — GLM 5.2와 MiniMax M3가 Sonnet 4.6과 거의 대등한 성능을 기록함.
- 평가 기준 — 코드의 품질보다는 지시 사항 준수와 작업 완료 여부에 초점을 맞춤.
- 비용 효율성 — Qwen 3.7-Plus가 가장 저렴하며, GLM 5.2는 Sonnet보다 저렴하면서 높은 점수를 받음.
- 향후 계획 — GLM의 높은 성능을 확인한 후 Opus와의 추가 비교 평가를 진행할 예정임.
1,000개에 가까운 코딩 에이전트 시나리오에서 GLM 5.2, MiniMax M3, Kimi K2.7-code, Qwen 3.7-Plus, Sonnet 4.6을 벤치마크함.
작업은 Tessl Registry의 기술을 기반으로 했으며, 관련 기술 로드 여부에 따라 평가됨. 데이터셋은 Hugging Face의 task-evals-for-skills 프로젝트에서 공개적으로 이용 가능함.
Tessl 내부에서 기술 및 에이전트 워크플로우를 평가하는 과정에서 실행함.
| Model | Overall | Instruction Following | Task Completion | Cost / Task |
| --- | --- | --- | --- | --- |
| GLM 5.2 | **91.9** | 87.4 | 97.8 | $0.289 |
| MiniMax M3 | **91.4** | 87.2 | 97.0 | $0.207 |
| Sonnet 4.6 | **90.8** | 86.1 | 97.1 | $0.296 |
| Kimi K2.7-code | 88.7 | 82.5 | 96.9 | $0.661 |
| Qwen 3.7-Plus | 82.2 | 77.2 | 88.9 | $0.068 |
상위권 격차가 예상보다 훨씬 작았음. GLM 5.2는 전체적으로 Sonnet보다 앞섰고 작업당 비용도 약간 더 저렴했음. MiniMax M3도 뒤처지지 않음. (참고로 MiniMax가 좀 불안정하고 리스트 상단에 있는 걸 보고 싶지 않을 수도 있겠지만, 결과가 이렇게 나옴)
GLM이 상위권에 근접했기에, Opus와도 별도로 비교 평가를 진행할 예정임. 결과가 어떨지는 모르겠지만, 이번 결과를 보니 격차가 여전할 거라 가정하기보다 테스트해 볼 가치가 있다고 판단함. :)
실행 결과를 자세히 살펴보니 모델 간 작업 완료 능력에는 큰 차이가 없었음. 더 큰 차이는 지시 사항 준수에서 나타남. 대부분 작업은 완수했지만, 요청한 방식대로 수행했는지가 관건이었음.
맥락을 더하자면, 이건 관련 기술/컨텍스트 로드 여부에 따른 코딩 에이전트 작업 벤치마크임. 비판하려는 게 아님. 다 사랑해서 하는 거임. 🙂
전체 벤치마크 읽기: https://tessl.io/blog/open-source-coding-agents-one-ties-sonnet-one-wont-listen/


