24GB + 64GB VRAM 환경에서 Qwen Next 구동 가능할까?
Qwen Next on 24 + 64 GB VRAM?
핵심 요약
RTX 3090과 CMP 170HX 조합으로 Qwen Next 모델을 구동하려는 시도에 대해 사용자들의 기술적 조언과 설정 공유가 이어지고 있습니다.
- 하드웨어 구성 — RTX 3090 24GB와 CMP 170HX 64GB 조합으로 고사양 모델 구동을 시도함
- 구동 가능성 — 적절한 양자화와 파이프라인 병렬 처리를 통해 구동 가능하다는 의견이 지배적임
- 성능 병목 — PCIe 2.0 x4 대역폭 제한으로 인해 DRAM 오프로딩은 속도 저하의 주원인이 됨
- 최적화 팁 — exllama3, llama.cpp, vLLM 등을 활용한 레이어별 분산 처리와 SSD 기반 n-gram 활용이 권장됨
다들 안녕,
지금 3090 24GB 하나랑 64GB짜리 CMP 170HX 언락해서 쓰고 있어. 램은 DDR4 64GB 박아놨고.
이 GPU 두 개 다 써서 Qwen 3.8 Next 돌릴 방법 있을까? 남는 건 DRAM으로 오프로딩하면 될 것 같은데. 그럭저럭 쓸만한 속도 뽑을 수 있는 방법 없을까?
CMP 170HX는 PCIe 속도(2.0 @ 4x)가 유일한 병목인데, 이것도 감안해야 할 듯. 뭐 일단 모델 로드만 다 되면 딱히 문제 될 건 없긴 하더라.
지금 CMP 170HX로 Qwen 3.7 27B나 Minimax H3를 BF16으로 돌리고 있는데 속도 꽤 잘 나오거든. 그래서 GPU 성능은 충분하다고 보는데, Qwen Next는 차원이 다른 놈이라 좀 빡세네.
좋은 아이디어 있는 사람?

