12GB VRAM 카드에서 Qwen3.8-Flash-Next 로컬 구동하기
Running Qwen3.8-Flash-Next locally on a 12GB VRAM card
핵심 요약
12GB VRAM 환경에서 DDR5 RAM을 활용해 Qwen3.8-Flash-Next 모델을 초당 20토큰 속도로 구동하는 최적화 방법 공유.
- 하드웨어 최적화 — RTX 4070과 DDR5 RAM 조합으로 20t/s 성능 달성함
- MTP 활용 — PR #28243과 Compact MTP 적용으로 추론 속도 향상됨
- RAM 의존성 — GPU VRAM 부족분을 고속 DDR5 RAM으로 보완하여 구동함
- 양자화 비교 — AtomicChat의 4.27 bpw 양자화가 용량 대비 효율적임
carteakey.dev
원문 사이트로 이동
이제 좀 잠잠해졌으니, 비교적 중급 사양 하드웨어(RTX 4070 12GB + 64GB DDR5-5600 + Gen4 NVMe, 리눅스 환경)에서 Qwen3.8-Flash-Next(125B-A6B MoE + 51B n-gram 테이블)를 돌려본 후기를 써봄.
처음엔 꼴랑 6 tok/s 나오던 게 최신 패치랑 최적화 거치면서 20 tok/s 가까이 뽑히는 중임. 그냥 램만 충분하면 됨.
지금 내 사양에서 뽑아낼 수 있는 지능의 한계치라고 본다. 27B 덴스 모델은 VRAM이 딸려서 선택지에 없지만, 24GB VRAM 쓰는 애들한테는 더 나을 수도 있음. 근데 사실 대부분 작업에서 27B 모델보다 성능 잘 나와서 VRAM은 적고 램 용량 크고 빠른 환경에선 이게 최고임.
PP는 아직 300-350 tok/s 정도로 좀 낮은 편.
도움 된 것들
- AtomicChat의 4.27 bpw 양자화 사용 https://huggingface.co/AtomicChat/Qwen3.8-Flash-Next-GGUF
- Ngram SSD 오프로딩 (레이지 모드)
- --fit-target 512 옵션으로 --fit 돌리면 알아서 적절한 파라미터 잡아줌.
- 마스터 브랜치 (19.35 t/s): MoE 개선 사항 들어간 최신 커밋.
- MTP 변형 - PR #28243 + Compact MTP (20.65 t/s): MTP 지원이 아직 머지 안 돼서 이 PR을 직접 적용해야 함. Daniel Han의 1.78 GB shared-Q4_K_M 컴팩트 헤드를 쓸 수 있게 해줌. 여기에 -ncmoe 45 조합하니까 수락률 77~96% 찍히면서 테스트한 모든 작업(코딩, 요약, 창작)에서 20 t/s 벽을 뚫어버림.
VRAM이 워낙 적어서 MTP 헤드를 VRAM에 올리려고 레이어를 몇 개 포기해야 하니까 성능 향상이 엄청 드라마틱하진 않음. MTP에서 shared + Q4_K_M 조합일 때만 유의미한 상승이 있음.
상용 모델 써서 로컬 모델 추론 연구하고 최적화하고 벤치마크 돌리는 게 진짜 도움 많이 됨(GLM 5.3 플래시랑 opencode go, Astra, Gemini 3.8 등등).
더 자세한 내용은 게시물(AI 도움받음)에 적어놨음.

