GTX 1060 6GB에서 qwen3.6-35b-a3b-mtp 구동하기
qwen3.6-35b-a3b-mtp running on GTX 1060 6GB
핵심 요약
10년 된 워크스테이션과 GTX 1060으로 최신 LLM을 실사용 가능한 수준으로 구동한 사례.
- 하드웨어 사양 — 10년 된 Dell T5810과 GTX 1060 6GB 환경에서 구동함.
- 구동 설정 — LMStudio를 사용하여 MTP 및 MOE 레이어 오프로드 설정을 최적화함.
- 성능 결과 — 프리필 130~150tps, 디코드 16tps로 챗봇으로 쓰기에 충분함.
10년 된 Dell T5810 워크스테이션(32GB DDR3 메모리, E5-2698v3 16코어 32스레드)과 예전에 채굴용으로 쓰던 GTX 1060 6GB(이미 본전은 진작 뽑음)를 가지고 있습니다. 윈도우 환경에서 LMStudio를 사용해 모델을 구동하는 데 성공했습니다. 설정은 다음과 같습니다.
Model: unsloth qwen3.6-35B-a3b-MTP-GGUF UD Q4_K_XL
Ctx length: 131072
GPU offload: 41
CPU threadpool size: 16
Max concurrent: 4
Number of experts: 8
Number of MOE layers offloaded to CPU: 41
MTP max draft: 3
KV quantization: both Q4_0
prefill 16k: about 130-150tps
decode 4k: about 16tps
챗봇으로 쓰기에 아주 좋습니다.


