DeepSWE에서 테스트한 Qwen 3.6 27B 성능
Qwen 3.6 27B on DeepSWE
핵심 요약
Qwen 3.6 27B의 DeepSWE 벤치마크 결과와 로컬 모델의 한계에 대한 고찰입니다.
- 벤치마크 결과 — 2%의 점수를 기록하며 18/20위를 차지함
- 테스트 환경 — RTX6000 pro Blackwell GPU와 VLLM을 사용하여 70시간 동안 진행
- 모델 성능 — 3.6 Plus와 유사한 성능을 보이며 verbose하다는 평판과 달리 토큰 효율은 준수함
- 로컬 모델의 미래 — 최상위 모델과의 격차로 인해 로컬 모델의 경쟁력에 의문이 제기됨
개요:
-
2% (반올림 시 1.79%)의 점수를 기록함
-
Haiku 4.5와 Minimax M2.7보다 높은 점수로 20위 중 18위를 차지함
-
전체 벤치마크는 70시간 소요됨
-
작업당 평균 시간 32분
-
작업당 평균 출력 토큰: 44k
관점:
-
3.6 Plus와 의심스러울 정도로 비슷한 점수를 기록했는데, 3.6 Plus의 아키텍처가 27B와 어떻게 다른지 정말 궁금함.
-
Qwen 3.6 27B는 장황하다는 평판이 커뮤니티에 있지만, 놀랍게도 출력 토큰 수는 비슷한 모델들과 비슷하거나 더 적었음.
방법론:
-
VLLM에서 BF16 KV 캐시, 추론 활성화, 262k 컨텍스트 윈도우를 적용한 Qwen 3.6 27B FP8 모델 사용.
-
RunPod에서 1x RTX6000 pro Blackwell로 모델 구동.
-
Modal 샌드박스에서 mini-swe 에이전트 하네스로 실행.
-
시간을 절약하기 위해 공식 4회가 아닌 작업당 1회 롤아웃을 실행했으며, 이 때문에 이미지에 점수 범위가 표시되지 않음.
-
비용은 RunPod 시간당 요금 내에서 완료된 작업을 기준으로 계산됨.
-
전체 벤치마크 실행을 조정하고 모니터링하기 위해 Codex 5.5xhigh가 사용됨.
src
최고의 오픈 소스 모델인 Kimi-k2.6조차 최첨단 성능과는 거리가 멂. 대부분은 Kimi를 로컬에서 돌리지도 못하고, Qwen 3.6 27B 같은 모델은 로컬판 '가난한 자의 SOTA'임. 최첨단 성능을 내려면 엄청난 규모가 필요한 것으로 보임. 경쟁력이 생기기 시작하는 모델들은 금방 클로즈드 소스로 전환되는 경향이 있음. 로컬이 이길 것 같지 않음. 오히려 "로컬이 얼마나 처참하게 질 것인가"라는 게임처럼 느껴짐.

