5년 된 6GB VRAM 노트북으로 Qwen3.6-35B-A3B 모델 구동하기
Pushing a 5-Year-Old 6GB VRAM laptop to Its Limits: Qwen3.6-35B-A3B
핵심 요약
5년 된 노트북에서 6GB VRAM으로 Qwen3.6-35B 모델을 성공적으로 구동한 경험과 설정값을 공유함.
- 하드웨어 최적화 — 5년 된 RTX 2060 노트북에서 35B 모델 구동에 성공함.
- 성능 테스트 — 초당 23토큰 속도로 실사용 가능한 수준을 확보함.
- 기술적 공유 — llama-server 설정값과 롱 컨텍스트 구동 스크립트를 공개함.
- 블로그 피드백 — 기술적 내용 위주로 글을 다듬으라는 조언을 받음.
지난 몇 주 동안 이 모델을 내 하드웨어에서 돌리려고 노력해왔음. 오픈 모델들이 얼마나 좋아졌는지 정말 놀라울 따름임. 이 서브레딧과 멋진 사람들 덕분이 아니었다면 이 모델을 내 5년 된 노트북에서 돌릴 수 없었을 거임. 모델은 실제로 초당 약 23토큰 속도로 사용 가능함... 심지어 전원을 연결하지 않아도 10토큰 이상 나옴! pi agent와 함께 쓰기에 아주 좋음.
이 설정을 개선할 방법이 있다면 더 알고 싶음...
내 전체 localmaxxing 여정을 블로그 포스트 여기에 기록해뒀으니, 누군가에게 도움이 될지도 모름.
TL;DR
노트북: Asus ROG Zephyrus G14 2020
CPU: Ryzen 7 (8c 16t) @ 2900 Mhz (부스트 비활성화)
메모리: 24GB DDR4-3200 RAM
GPU: RTX 2060 Max-Q 6GB VRAM
일반 설정:
#!/bin/bash
llama-server \
-m ~/dev/models/Qwen3.6-35B-A3B-APEX-GGUF/Qwen3.6-35B-A3B-APEX-I-Compact.gguf \
-mm ~/dev/models/Qwen3.6-35B-A3B-GGUF/mmproj-F16.gguf \
--no-mmproj-offload \
-a Qwen3.6-35B-A3B-APEX-64k \
--host 0.0.0.0 --port 8000 \
--fit off -fa on \
--ctx-size 65536 \
--threads 8 --threads-batch 12 \
--cpu-range 0-7 --cpu-strict 1 \
--cpu-range-batch 0-11 --cpu-strict-batch 1 \
--numa isolate \
--prio 2 \
--no-mmap --parallel 1 --jinja \
--cache-type-k q8_0 --cache-type-v q8_0 \
--ubatch-size 1024 --batch-size 2048 \
--n-cpu-moe 36 \
--cache-reuse 256 \
--ctx-checkpoints 8 \
--metrics \
--cache-ram 4096 \
--spec-type ngram-mod \
--spec-ngram-mod-n-match 24 --spec-ngram-mod-n-min 12 --spec-ngram-mod-n-max 48
롱 컨텍스트: (Tom의 포크 버전)
#!/bin/bash
lm-server-tq \
-m ~/dev/models/Qwen3.6-35B-A3B-APEX-GGUF/Qwen3.6-35B-A3B-APEX-I-Compact.gguf \
-a Qwen3.6-35B-A3B-APEX-128k \
--host 0.0.0.0 --port 8000 \
--fit off -fa on \
--ctx-size 131072 \
--threads 8 --threads-batch 12 \
--cpu-range 0-7 --cpu-strict 1 \
--cpu-range-batch 0-11 --cpu-strict-batch 1 \
--numa isolate \
--prio 2 \
--no-mmap --parallel 1 --jinja \
--cache-type-k turbo3 --cache-type-v turbo4 \
--ubatch-size 1024 --batch-size 2048 \
--n-cpu-moe 36 \
--cache-reuse 256 \
--ctx-checkpoints 8 \
--metrics \
--cache-ram 4096 \
--spec-type ngram-mod \
--spec-ngram-mod-n-match 24 --spec-ngram-mod-n-min 12 --spec-ngram-mod-n-max 48
