StepFun의 Step 5 프리뷰, Terminal Bench 2.1에서 독립적 테스트 완료
StepFun's Step 5 Preview Independently Tested on Terminal Bench 2.1
핵심 요약
Step 5 프리뷰 모델의 벤치마크 성능을 다른 무료 모델들과 비교 분석한 결과입니다.
- 벤치마크 결과 — Terminal Bench 2.1에서 50.2%의 Pass@1 성능을 기록함
- 토큰 효율성 — Space Bunny보다는 적게, LongCat 2.5보다는 많은 토큰을 소모함
- 모델 비교 — Space Bunny, LongCat 2.5, MiMo v2.5와 유사한 성능군에 위치함
- 향후 계획 — opencode zen에서 제공되는 MiMo v2.6 flash 등 추가 모델 테스트 예정
Step 5 Preview Free 일주일 동안 무료로 풀렸다. 그래서 최근에 무료로 풀린 다른 모델들(이랑 mimo v2.5)이랑 벤치마크 돌려봤는데, 성능은 딱 그 수준임. TB 2.1 89개 태스크 기준으로 Step 5는 문제의 48~53% 정도 해결했고, 토큰은 space bunny보다는 적게 쓰는데 longcat 2.5보다는 많이 먹더라.
| Model | Pass@1 | Pass@3 | Tokens Per Trial |
|---|---|---|---|
| Step-5 Preview Free | 50.2% (134/267) | 64.0% (57/89) | ~0.90M |
| Space Bunny Free (retired) | 52.1% (139/267) | 66.3% (59/89) | ~1.69M |
| LongCat 2.5 Preview Free | 48.7% (130/267) | 64.0% (57/89) | ~0.54M |
| MiMo v2.5 | 44.2% (118/267) | 66.3% (59/89) | ~0.57M |
마지막으로 opencode zen 통해서 mimo v2.6 flash 같은 모델들도 더 무료로 풀린 거 아는데, 아직 거기까지는 손을 못 댔음.
다들 써보니까 어떰? 니들 경험이랑 좀 비슷함?
