llama.cpp에서 작은 모델을 GPU VRAM에만 올리는 게 가능할까?
GPU VRAM only for small models with llama.cpp: is it possible?
핵심 요약
llama.cpp 사용 시 작은 모델을 VRAM에만 로드하여 호스트 RAM 점유를 최소화하는 방법을 찾는 중.
- VRAM 최적화 — 작은 모델을 호스트 RAM 없이 GPU VRAM에만 완전히 로드하는 설정 탐색.
- llama.cpp 설정 — mmap, flash attention, 캐시 타입 등 다양한 옵션으로 RAM 점유율 줄이기.
- 기술적 한계 — llama.cpp의 구조상 KV 캐시나 메타데이터 등으로 인해 약간의 호스트 RAM은 필수적임.
- 해결책 제안 — fit-target, cache-type-k/v 설정 및 특정 모델 아키텍처 선택으로 최적화 시도.
학습 중인 단계라 지금까지는 제 설정(4070 12GB VRAM + 32GB RAM, GUI용 iGPU)으로 만족스럽게 사용하고 있었습니다. Gemma4 26B와 Qwen 3.6 35B MoE 모델을 높은 양자화 수준과 큰 컨텍스트로 돌려봤고, 둘 다 40 t/s 정도가 나왔습니다.
하지만 이제는 호스트 메모리 속도 저하 없이 VRAM만 꽉 채워서 더 작은 모델, 이상적으로는 Qwen3.5-9B 양자화 버전을 써보고 싶습니다. 이론상으로는 가능해야 하는데, gemma4-e2b를 낮은 양자화(Q4_IXS)와 작은 컨텍스트(8192)로 돌려도 GPU 외에 3.5GB 정도의 RAM을 추가로 사용하게 됩니다.
llama-server에서 찾을 수 있는 모든 명령줄 옵션을 시도해봤지만, 아직까지는... 별 소득이 없네요.
제가 뭘 잘못하고 있는 걸까요?


