노트북에서 돌리는 Qwen3.6 35B-A3B: 나의 '0에서 1' 순간
Qwen3.6 35B-A3B on a Laptop: My Zero to One Moment
핵심 요약
노트북 환경에서 로컬 LLM을 처음 성공적으로 구동하며 느낀 경험과 최적화 팁을 공유하는 글입니다.
- 로컬 모델 구동 — 개인 정보 보호를 위해 클라우드 대신 로컬 모델을 활용함
- 성능 최적화 — llama.cpp와 MTP 설정을 통해 노트북에서 준수한 TPS를 확보함
- 하드웨어 고민 — 더 나은 성능을 위해 고성능 데스크탑 구축을 고려함
- 모델의 한계 — Qwen3.6 모델의 가끔 발생하는 '게으름'과 비결정적 특성을 관찰함
다들 안녕, 여기는 처음이라 인사해. 노트북 하나로 버티다가 로컬 모델 성능이 이제 진짜 쓸만하다는 걸 얼마 전에야 깨달았거든. 혹시라도 다른 사람들에게 도움이 될까 싶어서 내 경험을 좀 공유하고, 여기 고수들한테 배우고 싶은 것도 있어서 글 써봐.
내가 쓰는 ASUS Zenbook Pro 14(RTX 4060 8GB VRAM, 64GB RAM)에서 처음으로 제대로 돌아가는 모델이야.
-
속도 준수함: 32k 컨텍스트에서 초당 약 27토큰(TPS), 256k 컨텍스트에서도 초당 약 18토큰 정도 나옴.
-
똑똑함: 파일 읽고 쓰기, 스킬 사용, CLI 명령어 실행, git 사용, 지시 사항 이행까지 다 되고, 꽤 괜찮은 사고 파트너 역할도 해.
이게 나한테 왜 중요하냐면, 내가 무의식적으로 선을 그어버린 지점이기 때문이야. 클라우드 모델(TEE 방식이라 해도)에는 개인 정보나 사적인 생각을 공유하고 싶지 않았거든. 물론 해킹당해서 데이터 털릴 가능성이 아예 없는 건 아니지만, 처음부터 프롬프트에 내 정보를 다 갖다 바치는 거랑은 차원이 다르잖아.
그래서 처음으로 나만의 완전한 로컬 '제2의 뇌'를 갖게 됐어. 나한테는 진짜 게임 체인저야.
공적인 건 여전히 클라우드 모델 써.
공개된 프로젝트 할 때는 클라우드 모델을 쓰긴 하는데, 브레인스토밍이나 간단한 개인 프로젝트 할 때는 이제 로컬 모델로도 충분해. 더 본격적인 코딩을 해보려고 성능 좋은 데스크탑도 알아보고 있어. 맛을 한번 보니까 더 욕심나네 😄
이제 Claude 쓸 때마다 뜨는 "✽ Envisioning… (41s · ↓ 2.9k tokens · thinking some more with high effort)" 같은 블랙박스 문구 보면 진짜 답답해 죽겠어. 제대로 가고 있는 건지 알 수가 없으니까. (이게 효율적인 방식인지는 둘째치고 말이야)
Qwen3.6 쓰면서 느낀 문제점들
Qwen3.6 35B A3B가 완벽한 건 아니라서, 내가 겪은 사소한 문제점 몇 개 적어볼게. 뭐, 다 우회 가능한 수준이야.
-
가끔 헛소리하는데, 보통은 스스로 복구해.
-
아주 가끔 무한 루프에 빠지기도 해. 사람이 좀 지켜봐 줘야 하는데, 난 이 정도면 괜찮다고 봐.
-
컨텍스트에 충분히 들어갈 내용인데도 스킬을 제대로 안 읽거나 최선의 결정을 못 내릴 때가 있어. 가끔 좀 "게으른" 느낌이야.
-
비결정론적인 성향이 강해. 딱히 설정을 건드리진 않았어(어차피 결과물은 내가 원하는 대로 나오니까).
아마 양자화 단계를 좀 더 높이면 개선될지도 모르겠네.
내 세팅
추론은 llama.cpp를 쓰고, unsloth의 Qwen3.6-35B-A3B-UD-IQ3_XXS.gguf 모델을 돌려.
하네스는 Pi랑 pi-llama-cpp 확장 기능을 사용해. 하네스는 multipass에서 돌아가고 llama.cpp가 실행 중인 호스트에 연결돼 있어. E2EE Matrix 채팅(pi-messenger-bridge 기반으로 직접 만든 거)을 통해 내 폰이랑도 연결해 놨는데, 노트북을 항상 켜둬야 해서 좀 귀찮긴 해. 24시간 내내 켜놔도 부담 없는 컴퓨터를 새로 사려는 또 다른 이유지.
256k 컨텍스트(18tps)용 llama.cpp 플래그:
./build/bin/llama-server -m Qwen3.6-35B-A3B-UD-IQ3_XXS.gguf -ngl 24 -np 1 -fa on -ctk q4_0 -ctv q4_0 -c 262144 --host 0.0.0.0 --port 8088 -ncmoe 32 --no-mmap --jinja
32k 컨텍스트(27tps)용 llama.cpp 플래그:
./build/bin/llama-server -m Qwen3.6-35B-A3B-UD-IQ3_XXS.gguf -ngl 99 -np 1 -fa on -ctk q4_0 -ctv q4_0 -c 32000 --host 0.0.0.0 --port 8088 -ncmoe 32 --no-mmap --jinja

