Qwen 3.6 35B A3B 모델의 하입은 진짜다!!!
The Qwen 3.6 35B A3B hype is real!!!
핵심 요약
최신 로컬 LLM들이 긴 컨텍스트 처리 능력을 바탕으로 복잡한 코드 이해 및 분석에서 뛰어난 성능을 보여줌.
- 모델 성능 향상 — 최신 로컬 모델들이 긴 컨텍스트를 지원하면서 코드 이해도가 비약적으로 상승함.
- Qwen 3.6 평가 — 35B A3B 모델이 특히 코드 분석 및 논문 매핑 작업에서 압도적인 성능을 입증함.
- 하드웨어 제약 — 로컬 환경에서 긴 컨텍스트를 돌리기 위해 VRAM 확보와 양자화 설정이 중요해짐.
- 실무 활용 팁 — 첫 프롬프트의 구체성과 모델별 특성에 맞는 워크플로우 최적화가 작업 효율을 결정함.
내 로컬 LLM 지능 테스트 방식은 내가 학술 연구용으로 짠 코드를 모델이 이해할 수 있는지 확인하는 거임. 내 연구는 꽤 틈새 분야라 LLM 학습 데이터에 제대로 포함됐을 리가 없음. 몇 달 전만 해도 로컬 모델들의 코드 이해도는 Devstral Small 2가 최고였을 정도로 고만고만했음. 하지만 요즘 작은 오픈 웨이트 모델들은 긴 컨텍스트를 처리하는 방법(gated delta net, hybrid Mamba2, sliding window attention)을 갖춰서 엄청 똑똑해짐. 이제는 학술 논문 전체랑 관련 코드를 모델한테 던져주고 논문을 참고해서 코드가 뭘 하는지 설명하라고 시킬 수 있음.
내가 며칠 동안 실험해본 모델들임:
- Qwen 3.6 35B A3B
- Qwen 3.6 27B
- Gemma 4 26B A4B
- Nemotron 3 Nano
전부 다 몇 달 전 로컬 모델들이랑은 비교도 안 될 정도로 내 코드를 잘 이해함. Devstral Small 2도 써보려고 했는데, 최근에 16GB 그래픽카드 하나에서 두 개로 늘렸음에도 32GB 램에 긴 컨텍스트를 다 올릴 수가 없었음. Mistral에서 gated delta net 적용한 새 모델 내주면 좋겠음. 그럼 바로 왕좌 탈환할 것 같음.
여기에 내 상세 실험 결과가 있음. 로컬 모델들한테 내 코드가 논문이랑 어떻게 매핑되는지 설명하라고 시킨 결과임.
TLDR: 위에 적은 네 모델 다 엄청나게 유능함. 그중에서도 Qwen 3.6 35B A3B가 단연 최고임. 그리고 이 네 모델 중 하나만 있으면 똑똑한 사람 한 명이 Opus 4.7 혼자 쓰는 것보다 더 유능할 거라고 생각함(상세 결과 참고).
다들 어떻게 생각하는지 알려줘!

