8GB VRAM(32GB RAM)에서 Qwen3.6-35b 256k 무료 코딩 환경 구축하기
Free coding using qwen3.6-35b 256k on 8gb vram (32GB RAM)
핵심 요약
오래된 GTX 1070 GPU 환경에서 llama.cpp를 활용해 Qwen3.6-35B 모델을 효율적으로 구동하는 방법을 공유합니다.
- 하드웨어 최적화 — 8GB VRAM과 32GB RAM 환경에서 262K 컨텍스트 윈도우를 구현함
- 성능 수치 — 초당 25.91 토큰 생성 속도와 80.7%의 MTP 수용률을 달성함
- 설치 가이드 — Linux 환경에서 llama.cpp를 빌드하고 모델을 실행하는 상세 과정을 제공함
- 모델 활용 — 구형 GPU에서도 고성능 코딩 모델을 무료로 구동할 수 있음을 입증함
드디어 묵혀뒀던 NVIDIA GTX 1070 PC(8GB VRAM, 32GB RAM)에 llama.cpp 세팅을 마쳤다. 성능 좀 뽑아내려고 몇 시간 동안 삽질했는데, 이제 Qwen3.6-35B-A3B 모델을 262K 컨텍스트 윈도우, 25.91 tok/s 생성 속도, 80.7% MTP 수락률로 돌릴 수 있게 됐다.
완전 무료인데 코딩용으로 쓰기엔 놀라울 정도로 성능이 잘 나온다. 리눅스 Pop!_OS(우분투 기반)에서 설치하고 세팅한 방법 공유한다.
Install llama.cpp
sudo apt update
sudo apt install -y nvidia-cuda-toolkit
sudo apt install -y git build-essential cmake
cd ~
git clone https://github.com/ggml-org/llama.cpp.git
cd ~/llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)
./build/bin/llama-server --version && \
./build/bin/llama-server --list-devices
pipx install huggingface_hub
mkdir -p ~/models
Update llama.cpp (optional)
cd ~/llama.cpp
git pull --ff-only
cmake --build build --config Release -j$(nproc)
Download Qwen3.6
mkdir -p ~/models/qwen3.6-35b-mtp
hf download unsloth/Qwen3.6-35B-A3B-MTP-GGUF \
--local-dir ~/models/qwen3.6-35b-mtp \
--include "*UD-Q4_K_XL*"
Configure and run Qwen3.6
export GGML_CUDA_DISABLE_GRAPHS=1
~/llama.cpp/build/bin/llama-server \
-m ~/models/qwen3.6-35b-mtp/Qwen3.6-35B-A3B-UD-Q4_K_XL.gguf \
--ctx-size 262144 \
--n-cpu-moe 37 \
--flash-attn on \
--load-mode none \
--cache-type-k q4_0 \
--cache-type-v q4_0 \
--spec-draft-type-k q4_0 \
--spec-draft-type-v q4_0 \
--batch-size 2048 \
--ubatch-size 256 \
--parallel 1 \
--threads 4 \
--spec-draft-threads 2 \
--spec-type draft-mtp \
--spec-draft-n-max 2 \
--host 127.0.0.1 \
--port 8080
결과는 8GB GTX 1070이랑 32GB 시스템 램으로 262,144 토큰 컨텍스트에 25.91 tok/s, 그리고 80.7% MTP 수락률 찍었다.


