RTX 3090 + 64GB RAM에서 Qwen3.8-Flash 구동하기 (VRAM은 12GB만 있으면 됨)
Qwen3.8-Flash on RTX3090 + 64GB RAM (but you only need 12GB VRAM)
핵심 요약
RTX 3090과 64GB RAM 환경에서 Qwen3.8-Flash 모델을 효율적으로 구동하는 설정과 배포 방법을 공유합니다.
- 하드웨어 설정 — RTX 3090, 64GB RAM 환경에서 Qwen3.8-Flash 모델을 구동함
- 성능 지표 — 160 tok/s prefill 및 16 tok/s decode 성능을 기록함
- 배포 방법 — pixi-llm-recipes를 활용한 원라인 배포 및 llama.cpp 설정 공유
- 최적화 팁 — VRAM 부족 시 KV 캐시 양자화 조정 및 오프로딩 전략 활용
RTX 3090, Ryzen 9 3950X, PCIe 3.0 메인보드, 2020년산 64GB DDR RAM 조합으로 Qwen3.8-Flash-next 돌려봤다.
IQ4_XS 가중치에 kvarn5 컨텍스트 풀로 땡기고, 비전은 GPU, 전문가 모델은 호스트 RAM, n-gram은 디스크에 박아놨음.
MTP는 돌아가긴 하는데, 예상대로 토큰 하나 거절될 때마다 호스트 RAM 대역폭을 잡아먹어서 80% 확률로 초안을 채택해도 디코딩 속도가 오히려 느려지네.
160 tok/s prefill, 16 tok/s decode 나오는데, 한두 시간 정도 자리 비울 때 돌려놓기엔 괜찮지만 실시간으로 쓰기엔 좀 무리다.
변형 설정
Qwen 모델들 KLD 차트 보면 kvarn5는 q8/q8이랑 구분도 안 됨. Beellama 쓰기 싫으면 q5_0/q5_0도 괜찮음(성능 하락 거의 없음). 여유 공간은 널널하니까 취향껏 KV 양자화를 q8/q8까지 올려도 됨.
KV를 kvarn4로 낮추고 비전 타워를 CPU로 돌리면 16GB VRAM으로도 데스크탑 띄울 공간은 나오는데, 대신 숨만 크게 쉬어도 뻗을 거다. 다른 거 돌릴 호스트 RAM이 거의 안 남거든. 그냥 q4_0/q4_0 KV는 성능 하락이 눈에 띄게 보이니까 비추함.
ub를 2048에서 512로 더 낮추면 12GB 카드에도 우겨넣을 순 있는데, 프리필 속도가 반토막 날 거다.
배포 방법
-
한 줄 배포 (CUDA Linux): https://github.com/crusaderky/pixi-llm-recipes . 서버 시작할 때
llamacpp-source-cuda선택해라. Vulkan이랑 ROCm에서도 돌아가긴 할 텐데 테스트는 안 해봄. -
llamacpp 포크만 쓰기: https://github.com/crusaderky/llama.cpp/releases/tag/beellama-staging-v0.4.4-r9; 좀 기다리면 메인 beellama 브랜치에 들어올 거임. 아니면 그냥 kvarn 없는 llamacpp 마스터 써도 되고.
-
llamacpp 프리셋: https://github.com/crusaderky/pixi-llm-recipes/blob/26ed50ace2a40772aa2b45d1358aaf0993fd5596/models.ini#L3-L94
u/andbeeld 님, v0.4.4 최종 나오기 전에 llamacpp 메인에서 한 번만 더 머지해주면 안 됨? 지금 마지막 머지가 Qwen3.8-Flash 지원 추가되기 딱 직전이라서.
근데 KV 캐시 양자화는 q8/q8 밑으로 내리면 절대 안 된다고 하던데?
남들 카더라 통신은 알 바 아니고. 이 모델 아직 테스트는 안 해봤는데 내가 테스트한 건


