저렴한 Radeon 7600에서 Qwen 3.5 35B A3B-Q8_0 GGUF 모델을 초당 18 토큰으로 구동하기
Running Qwen 3.5 35B A3B-Q8_0 gguf on a cheap radeon 7600 at 18 token/s
핵심 요약
저사양 그래픽카드와 DDR4 메모리 환경에서 llama.cpp를 활용해 Qwen 35B 모델을 효율적으로 구동하는 설정 공유.
- 하드웨어 환경 — Ryzen 5600, 64GB DDR4, Radeon 7600(8GB VRAM) 구성으로 구동함.
- llama.cpp 설정 — n-gpu-layers 999 및 n-cpu-moe 37 등을 사용하여 최적화함.
- 성능 결과 — 초당 18 토큰의 생성 속도와 47 토큰의 프롬프트 처리 속도를 기록함.
- 모델 비교 — Qwen과 Gemma 모델의 용도 차이 및 CPU 추론 성능에 대한 논의가 이루어짐.
나도 64GB DDR4, Ryzen 5600 쓰고 있음. llama.cpp 우분투 배포판 사용 중.
설정은 다음과 같음:
--n-gpu-layers 999 \
--n-cpu-moe 37 \
--no-mmap \
-ctk q8_0 \
-ctv q8_0 \
-fa 1 \
-c 9000

