Qwen3.8-Flash-Next 177B NVFP4(119GiB): RTX 5060 Ti 16GB + 32GB RAM에서 SSD 스트리밍으로 9-10 tok/s 달성
Qwen3.8-Flash-Next 177B NVFP4(119GiB): SSD streaming at 9-10 tok/s on one 16 GB RTX 5060 Ti + 32 GB RAM
핵심 요약
SSD 스트리밍을 활용해 VRAM 용량을 초과하는 대형 MoE 모델을 저사양 하드웨어에서 구동하는 추론 엔진을 개발함.
- SSD 스트리밍 기술 — VRAM과 RAM에 모델 일부를 올리고 나머지는 SSD에서 실시간으로 읽어와 대형 모델 구동함
- 성능 지표 — Qwen3.8-Flash-Next 177B 모델로 초당 9~10 토큰의 디코드 속도와 49.2 토큰의 프리필 속도 기록함
- 하드웨어 최적화 — RTX 5060 Ti와 32GB RAM 환경에서 NVFP4 양자화를 통해 효율적인 연산 수행함
- 향후 개선 방향 — SSD 스트리밍 효율을 높여 v2 버전에서 14~15 tok/s 디코드 속도 달성을 목표로 함
VRAM이랑 RAM 용량 부족해서 못 돌리는 MoE 모델들 돌리려고 InferredThoughts라는 추론 엔진을 만들었음. 모델 대부분은 SSD에 박아두고, 토큰 생성할 때 필요한 전문가(expert)만 그때그때 읽어오는 방식임.
이거 처음엔 그냥 개념 증명(PoC) 정도로 시작했는데, 막상 해보니까 Qwen3.8-Flash-Next NVFP4 모델로 9~10 tok/s 정도 나오더라 (벤치마크 기준 9.06, 잘 나올 땐 10.4).
이제 시작일 뿐임. SSD 스트리밍 최적화 더 하면 v2에서는 14~15 tok/s까지 뽑을 수 있을 듯.
Repo: InferredThoughts https://github.com/compiledthoughts/Inferred-Thoughts
Model: Qwen3.8-Flash-Next, 176.9B params, NVFP4 GGUF (119 GiB): https://huggingface.co/CompiledThoughts/Qwen3.8-Flash-Next-NVFP4-Q8_0
Machine: RTX 5060 Ti 16 GB, Ryzen 7 9700X, 32 GB DDR5, Gen5 NVMe SSD 1Tb, Windows 11
119 GiB는 어디에 있나
| part of the file | size | where |
|---|---|---|
| dense weights (attention, shared experts, LM head) | 4.4 GiB | VRAM |
| token embedding table | 0.6 GiB | RAM, one row read per token |
| hottest routed experts | 8.8 GiB | VRAM |
| next-hottest routed experts | 6.0 GiB | pinned RAM |
| remaining routed experts | 48.5 GiB | SSD, streamed on demand |
| n-gram table | 50.7 GiB | SSD, 16 rows read per token |
결국 20 GiB는 메모리에 있고, 나머지 99 GiB는 SSD에 박혀 있음. 라우터가 골라주는 전문가 모델 48.5 GiB랑, 해시된 n-gram 테이블 50.7 GiB(qwen4 n-gram 기대 중)가 SSD에 있음.

