16GB VRAM 사용자들에게: 남는 구형 GPU를 꽂으세요
To 16GB VRAM users, plug in your old GPU
핵심 요약
16GB VRAM 환경에서 구형 GPU를 추가해 VRAM을 확보하고 대형 모델을 구동하는 팁.
- VRAM 확장 — 16GB 카드에 6GB 카드를 추가해 22GB VRAM 환경을 구축함.
- Vulkan 활용 — llama.cpp 설정에서 Vulkan 백엔드를 사용해 다중 GPU를 연동함.
- 성능 최적화 — no-mmap과 n-gpu-layers 설정을 통해 VRAM 효율을 극대화함.
- 비교 데이터 부족 — 단일 카드 대비 성능 비교가 없어 실효성에 대한 의문이 제기됨.
최신 dense ~30b 모델을 돌리고 싶은데 VRAM이 16GB밖에 없는 사람들은, 6GB 이상의 구형 카드가 있다면 꽂아보세요.
모든 데이터가 VRAM에 들어가는 게 중요합니다. 비록 카드 하나가 꽤 구형이라도, 두 개를 합쳐서라도 말이죠.
저는 5070Ti 16GB와 구형 2060 6GB를 가지고 있습니다. 보통은 성능을 극대화하려면 같은 GPU 2개가 필요하다고 생각하죠. 하지만 어느 날 문득, 왜 시도해보지 않나 하는 생각이 들었습니다.
자, 만약 LLM만을 위해 메인보드를 새로 산 게 아니라면, 저처럼 진짜 PCI-E x16 슬롯 하나와 x16처럼 보이지만 실제로는 x4로 연결된 슬롯 몇 개가 있을 가능성이 매우 높습니다. 그게 바로 구형 카드를 꽂을 완벽한 슬롯이죠.
16GB + 6GB = 22GB, 24GB급 카드에 가까워지고 있습니다. 더 좋은 구형 카드가 있다면 운이 좋은 거고요!
그런 다음 llama-server를 아래와 같은 설정으로 사용하면 됩니다.
[*]
jinja = true
cache-prompt = true
n-gpu-layers = 999
no-mmap = true
mlock = false
np = 1
t = 0
[qwen/qwen3.6-27b]
model = ./Qwen3.6-27B-GGUF/Qwen3.6-27B-Q4_K_M.gguf
mmproj = ./Qwen3.6-27B-GGUF/mmproj-Qwen3.6-27B-BF16.gguf
reasoning = on
dev = Vulkan1,Vulkan2
c = 128000
no-mmproj-offload = true
cache-type-k = q8_0
cache-type-v = q8_0
몇 가지 구체적인 포인트:
- dev=Vulkan1,Vulkan2: 두 개의 GPU를 활성화합니다.
llama-server.exe --list-devices를 실행해서 무엇을 설정해야 할지 확인하세요. - no-mmap과 mlock=false: 모델을 RAM에서 멀리 유지합니다.
- np=1, no-mmproj-offload (또는 mmproj 모델을 제공하지 않음), cache-type-k 및 cache-type-v: 필요한 VRAM을 최소화합니다.
- n-gpu-layers=999: GPU 오프로딩을 우선시합니다. 뭐, 불필요할 수도 있지만 저는 유지할 겁니다.
- split-mode=layer: 레이어를 장치 간에 비대칭적으로 분할합니다.


