알리바바의 Qwen3.6-Plus가 코딩에서 Claude Opus를 이기고 있다!!
Alibaba's Qwen3.6-Plus is beating Claude Opus in coding!!
핵심 요약
알리바바의 신규 모델 Qwen3.6-Plus가 벤치마크에서 Claude Opus를 능가하며 코딩 성능으로 주목받고 있음.
- 벤치마크 성능 — Qwen3.6-Plus가 swe-bench 등에서 Claude Opus를 앞서는 결과를 보임.
- 효율적 설계 — 작은 모델 크기에도 불구하고 멀티 스텝 작업과 1M 컨텍스트를 지원함.
- 실제 성능 논란 — 벤치마크 수치와 실제 코딩 체감 성능 사이의 괴리에 대한 의구심이 제기됨.
- 오픈 소스 여부 — 현재 API로만 제공되며 로컬 실행 가능한 오픈 웨이트 모델인지에 대해 혼란이 있음.
알리바바가 방금 Qwen 3.6-Plus를 출시했는데 벤치마크가 좀 말도 안 됨.
terminal-bench에서 61.6점, swe-bench verified에서 57.1점을 기록함. 참고로 이 점수는 대부분의 에이전트 코딩 테스트에서 Claude 4.5 Opus, Kimi K2.5, Gemini 3 Pro를 앞서는 수치임.
미친 점은 Kimi K2.5나 GLM-5보다 크기가 절반도 안 된다는 거임. 훨씬 작은 모델인데도 대형 모델들과 대등하거나 더 나은 성능을 보여줌.
또한 1M 컨텍스트 윈도우를 기본으로 지원하는데, 긴 코드베이스나 대규모 문서 작업을 할 때 엄청난 장점임. 그리고 에이전트 워크플로우를 위해 특별히 설계되어서 단순히 "코드를 생성하고 잘 되길 바라는" 수준이 아님... 실제로 다단계 작업을 처리함.
이미 OpenRouter에서도 무료로 사용 가능함. 오픈 소스 버전도 곧 나올 것 같음.
링크는 댓글에 있음.


