Llama.cpp의 auto fit 기능이 생각보다 훨씬 좋네요
Llama.cpp's auto fit works much better than I expected
핵심 요약
Llama.cpp의 --fit 기능을 활용해 VRAM 용량을 초과하는 대형 모델도 효율적으로 구동할 수 있다는 경험 공유.
- Llama.cpp auto fit — VRAM 용량을 초과하는 모델도 효율적으로 로드하여 실행 가능함.
- 성능 최적화 — Oculink 연결 환경에서도 57 t/s의 준수한 속도를 보여줌.
- KV 캐시 양자화 — KV 캐시를 양자화하여 컨텍스트 길이를 늘리고 성능을 개선할 수 있음.
- MoE 아키텍처 — 35B 모델이 MoE 구조라 활성 파라미터가 적어 더 원활하게 작동함.
32GB VRAM이면 Qwen3.5 27B Q4나 Q6 같은 20GB 정도 모델이 한계라고 생각했음. VRAM에 다 안 들어가면 2 t/s 나올 줄 알았거든.
근데 완전히 틀렸음. 방금 llama.cpp에서 --fit 켜고 256k 컨텍스트로 Qwen3.6 Q8 돌려봤는데, 가중치만 해도 VRAM보다 큰데 Oculink로 연결된 5090에서 57 t/s가 나옴! 이거 진짜 마법임. VRAM에 다 안 들어가면 끝이라고 생각했던 사람들은 당장 해보셈!

