굴러다니는 구형 저VRAM GPU 있냐? llama.cpp에서 비전 mmproj용으로 쓰면 쏠쏠함
Got an old slow low vram GPU laying around? Might be worth it to use for Just Vision mmproj llama.cpp
핵심 요약
남는 구형 GPU를 비전 모델의 mmproj 연산 전용으로 활용해 메인 GPU의 VRAM을 확보하고 추론 속도를 높이는 팁 공유.
- GPU 활용 — 남는 저사양 GPU를 비전 연산에 할당하여 효율 증대함
- 성능 최적화 — --mmdev 옵션으로 비전 연산을 분리해 추론 속도 저하 방지함
- 병렬 처리 — 프리필과 인코딩을 분리된 GPU에서 동시에 실행해 시간 단축함
- 시스템 최적화 — 모니터 출력을 보조 GPU로 돌려 메인 GPU VRAM 추가 확보함
많은 사람한테 Vram은 진짜 귀한 자원이잖아. Vram 아끼겠다고 --no-mmproj-offload 쓰라는 사람들 많이 보이는데, 이거 쓰면 속도 진짜 암 걸릴 정도로 느려짐. 특히 에이전트 코딩 같은 거 할 때 쓰면 더더욱 그렇고. 가능하면 mmproj 전용으로 보조 GPU 하나 더 달아서 --mmdev CUDA1(니 GPU 번호) 이렇게 설정해 봐. --no-mmproj-offload 쓰는 것보다 훨씬 빠르고, 추론 속도에는 영향도 안 주니까 훨씬 이득임.
--mmdev

