Qwen3.6-35B-A3B와 9B 모델이 공식적으로 Terminal-Bench 2.0 리더보드에 등재되었습니다!
Qwen3.6-35B-A3B and 9B are officially on the public Terminal-Bench 2.0 leaderboard!
핵심 요약
Qwen3.6-35B-A3B 모델이 Terminal-Bench 2.0에서 Gemini 2.5 Pro를 넘어서는 성능을 기록하며 로컬 모델의 가능성을 입증했습니다.
- 성능 입증 — Qwen3.6-35B-A3B가 24.6%를 기록하며 Gemini 2.5 Pro를 상회하는 성능을 보여줌.
- 경량 모델의 약진 — 10B 미만의 9B 모델도 고난도 에이전트 벤치마크에서 유의미한 측정값을 기록함.
- 커뮤니티 기여 — 저사양 컴퓨팅 환경을 지향하는 커뮤니티의 지원 덕분에 이번 벤치마크 테스트가 가능했음.
- 오픈 소스 혁신 — 더 높은 순위를 목표로 오픈 소스 모델의 지속적인 발전을 도모함.
Qwen3.6-35B-A3B와 9B 모델이 공식적으로 Terminal-Bench 2.0 리더보드에 등재되었습니다!
little-coder × Qwen3.6-35B-A3B 모델이 24.6% (±3.2)를 기록하며, Gemini CLI의 Gemini 2.5 Pro(19.6%)와 Terminus 2의 Qwen3-Coder-480B(23.9%)를 상회하는 성적을 거두었습니다. 이렇게 어려운 벤치마크에서 Polyglot의 스캐폴드-모델 간극이 유지될 줄은 몰랐는데, 실제로 해냈네요!
little-coder × Qwen3.5-9B 모델은 9.2%를 기록하며 다소 겸손한 성적을 보였습니다. 하지만 10B 미만의 로컬 모델도 고난도 에이전트 벤치마크에서 측정 가능하며, 더 이상 무시할 수준이 아니라는 점을 다시 한번 입증했습니다.
요청하신 대로 이곳에 후속 소식을 전하는 게 맞다고 생각했고, 이 커뮤니티에 진심으로 감사드립니다. 현재 컴퓨팅 자원을 덜 쓰는 방향으로 혁신을 이끄는 곳은 이곳뿐이며, 이번 결과도 여러분이 밀어준 덕분에 가능했습니다.
이제 리더보드 정상으로 향할 시간입니다 👀 오픈 소스 가즈아!

