16GB VRAM + 32GB RAM에서 Qwen 3.8 Next 구동하기 - GPU 가난뱅이들을 위한 유용한/재미있는 글
Running Qwen 3.8 next on 16vram+32ram - A useful/fun post for the gpu poors
핵심 요약
제한된 하드웨어 사양에서 Qwen 3.8 Next 모델을 효율적으로 구동하기 위한 설정과 최적화 방법을 공유합니다.
- 하드웨어 최적화 — 16GB VRAM과 32GB RAM 환경에서 모델을 구동하기 위한 메모리 관리 기법을 설명함
- 메모리 매핑 활용 — N-gram 섹션을 SSD에서 스트리밍하고 핵심 연산을 RAM과 VRAM에 배치하여 효율을 극대화함
- 설정값 공유 — llama.cpp의 --n-cpu-moe 및 레이어 분할 설정을 통해 시스템 메모리 부족 문제를 해결함
- 성능 결과 — 64k 컨텍스트에서 약 18.3 tok/s의 디코딩 속도를 달성하며 실사용 가능성을 확인함
안녕 레딧. 심심해서 글 하나 올린다. 제대로 돌아가지도 않는 시스템에 Qwen 3.8 Next를 올리는 게 참 외롭고 멍청한 짓 같았는데, 커뮤니티에 도움 될까 싶어서 도전해 봤다. 이 REAP 버전을 Qwen 3.8 27B QK4랑 벤치마크 비교는 아직 안 해봤는데, 월드 지식 좀 날아간 거 감안해도 훨씬 잘 나올 거라 본다.
시스템 사양
-
GPU: NVIDIA GeForce RTX 5060 Ti (16 GB VRAM)
-
CPU: AMD Ryzen 7 7840HS (8 코어 / 16 스레드)
-
RAM: 32 GB DDR5 (OS 인식 약 30 GB)
-
iGPU: AMD Radeon 780M (RDNA3)
-
Swap: 8 GB zram
보면 알겠지만, 실제로 쓸 수 있는 시스템 메모리랑 VRAM 합쳐봐야 44.5 GB 정도다. iGPU가 OS를 담당해서 GPU를 완전히 비워두긴 했는데, 그래도 다 쑤셔 넣기엔 진짜 빠듯하다. 이 설정으로 Unsloth 양자화 모델 돌리면 그냥 바로 터져버리길래, 좀 더 빡센 놈이 필요했다. 그래서 딱 맞는 걸 찾았는데, 바로 이 REAP이다:
https://huggingface.co/AnonimousA/Qwen3.8-Flash-Next-REAP-320-GGUF
이게 진짜 대박인 게 전체 사이즈가 68.95 GB 정도라는 거다. 몇 기가 줄인 게 이 짓을 가능하게 만든 핵심이다.
모델 가중치 분석
모델 가중치 구성은 이렇다. 새로 추가된 n-gram 부분, 전문가(experts), 활성 레이어, 어텐션/SSM 레이어, 그리고 KV 캐시용 여유 공간까지 다 포함이다:
| Component | Weight (Approx) | Notes |
|---|---|---|
| N-gram / PLE Embedding | ~29.48 GB | The massive lookup table |
| MoE Routed Experts (320) | ~34.89 GB | The main expert slab (pruned from 512) |
| Attention / SSM / Router | ~4.33 GB | Core architecture weights |
| KV Cache | [TBD] | Context memory overhead |
당연히 SSD에서 이 모델 돌리면 속도 개판 난다. mmap 켜면 llama.cpp가 모델을 RAM에 안 올리고 OS 페이지 캐시에 의존하게 되는데, 그러면 초당 2토큰 정도 나와서 사실상 못 쓴다.
답은 --load-mode none 써서 전부 RAM에 박아버리는 거다. 다행히 모델의 N-gram 섹션은 SSD에서 lazy 으로 스트리밍해도 큰 문제 없다. 이건 그냥 거대한 룩업 테이블이라 연산량이 별로 안 들어가거든.
