16GB RTX 3080 노트북 + 32GB RAM + SSD에서 Qwen3.8 Flash Next 176B 구동하기
Running Qwen3.8 Flash Next 176B on a 16GB RTX 3080 Laptop + 32GB RAM + SSD
핵심 요약
일반 노트북 환경에서 MoE 모델을 효율적으로 구동하는 추론 엔진 TensorSharp을 소개하고 벤치마크 결과를 공유함.
- TensorSharp 엔진 — VRAM, RAM, SSD를 통합 관리하여 거대 모델을 효율적으로 구동함
- 벤치마크 결과 — Strata 대비 전체 처리 시간에서 압도적인 성능 우위를 보임
- 메모리 계층 구조 — SSD를 단순 스왑 공간이 아닌 MoE 실행 최적화 계층으로 활용함
- 사용자 하드웨어 — 16GB VRAM 노트북 환경에서도 176B 모델 구동이 가능함을 입증함
github.com
원문 사이트로 이동
그냥 평범한 노트북으로 거대한 MoE 모델을 어디까지 돌릴 수 있는지 궁금해서 한번 테스트해 봤다.
결론부터 말하면, Qwen3.8 Flash Next 176B가 아래 사양에서 돌아간다.
RTX 3080 노트북 — 16GB VRAM
32GB 시스템 RAM
SSD
128GB나 256GB RAM 박힌 워크스테이션도 아니고, 멀티 GPU 구성도 아니다.
내가 직접 만든 오픈소스 로컬 LLM 추론 엔진인 TensorSharp로 돌렸다.
단순히 176B 모델을 로드하는 건 별로 재미없지. 내 목표는 VRAM이랑 RAM 용량을 훨씬 뛰어넘는 모델을 실제로 '쓸 수 있게' 만드는 거였다.
접근 방식은 대충 이거다.
양자화(Quantization) + 캐시, VRAM, 시스템 RAM, SSD를 아우르는 MoE 인식 통합 스케줄링.
SSD를 그냥 최후의 수단인 스왑 공간으로 쓰는 게 아니라, TensorSharp가 MoE 실행 과정에서 메모리/스토리지 계층을 조율해서 적절한 시점에 적절한 전문가(expert) 데이터가 적절한 위치에 있게 만드는 방식이다.
전에 llama.cpp랑 TensorSharp 성능 비교를 해봤는데 결과가 꽤 고무적이었다. 이번에는 Strata랑 비교해보고 싶었다. 제한된 메모리 환경에서 거대 모델을 돌리는 Strata의 방식이 꽤 흥미롭거든.
첨부한 벤치마크 결과는 다음과 같다.
| Measurement | TensorSharp | Strata |
|---|---|---|
| Decode tokens/s | 11.09 (9.22–14.02) | 10.24 (9.37–10.46) |
| Whole-process time | 16.54s (14.95–19.31) | 62.15s (59.76–66.89) |
| Device-wide GPU peak | 14,832.5 MiB | 15,729 MiB |
| OS peak working set | 19.74 GiB | 18.51 GiB |
디코드 처리량은 11.09 vs. 10.24 tok/s로 꽤 비슷하다.
근데 더 놀라운 건 엔드투엔드 결과다. 이번 테스트에서 16.54s vs. 62.15s가 나왔다.
이게 로컬 LLM 추론이 나아갈 흥미로운 방향을 보여준다고 생각한다. 거대한 희소(sparse) MoE 모델을 다룰 때, 이제는 단순히 이런 질문을 던질 때가 아니다.
"이 모델을 돌릴 RAM/VRAM이 충분한가?"
