Qwen 3.6은 드디어 로컬 모델을 쓸 가치가 있다고 느끼게 해준 첫 모델이다
Qwen 3.6 is the first local model that actually feels worth the effort for me
핵심 요약
Qwen 3.6-35b 모델이 로컬 환경에서 뛰어난 성능과 속도를 보여주며 실사용 가능한 수준에 도달했다는 평가.
- 실사용 성능 — 로컬 모델임에도 코드 작성 및 수정 작업에서 높은 완성도를 보여줌.
- 하드웨어 효율성 — 5090+4090 환경에서 260k 컨텍스트를 활용해 초당 170토큰의 빠른 속도 구현.
- 모델 비교 논쟁 — GLM 4.7 등 다른 모델과의 성능 비교 및 하드웨어 사양에 따른 체감 차이 발생.
- 미래 기대감 — 대형 데이터센터 없이도 중급 PC에서 고성능 AI를 활용할 수 있는 가능성 확인.
퇴근 후 어제 시간을 좀 내서 새로운 qwen3.6-35b-a3b 모델을 테스트해 봤는데, 적어도 나한테는 로컬 모델을 사용하는 게 그만한 가치가 없다고 느껴지지 않은 첫 경험이었어.
나는 몇 달 동안 개인적인 프로젝트나 일회성 프로젝트에 LLM을 사용해 왔는데, 내가 열정을 느끼지 못하는 코드(Avalonia의 대부분 UI XML, 임베디드 시스템 C++)를 작성할 때 주로 썼어. 예전에는 Github 학생 프로그램 덕분에 Sonet과 Opus를 무료로 사용했었는데, 그게 취소됐거든. 로컬 모델도 꽤 오랫동안 시도해 봤지만, 지금까지는 모델들이 너무 멍청해서 일을 제대로 못 하거나, 일을 끝낼 수는 있어도 내가 직접 하는 게 나을 정도로 코드를 수정/조정/포맷팅/리팩토링하는 데 시간을 너무 많이 써야 했어.
Qwen3.6은 적어도 내 시스템과 프로젝트에서는 드디어 그런 상황을 바꾼 것 같아. 5090 + 4090에서 Q8 모델을 전체 260k 컨텍스트로 로드해서 돌리는데, 초당 약 170토큰이 나와서 내가 써본 모델 중 가장 빠른 모델 중 하나이기도 해. 그리고 최근에 써본 Gemma 4를 포함한 다른 모든 모델들과 달리, 실제로 작업을 완료할 수 있고 마지막에 약간의 가이드나 수정만 있으면 돼. 10번 중 9번은 모델이 '완료'된 후 스스로 변경 사항을 검토하라고 요청하는 것만으로도 잘못된 부분을 찾아내고 수정하기에 충분했어.
정말 인상 깊었고, 로컬 모델이 드디어 이 지점까지 도달하는 걸 보니 정말 멋지다고 생각해. 이 기술이 거대한 데이터 센터나 구독 서비스에만 국한되지 않고, 중급 컴퓨터에서도 충분히 활용할 수 있을 정도로 최적화되는 미래에 대한 희망을 줘.


