LayerStoRm 오픈소스 전문가 스트리밍: 2개의 RTX 5090 + 2개의 RTX 5080으로 1M 컨텍스트 GLM-5.3-Flash [UD-Q4_K_XL] 구동 (24.5 tok/s @8k)
LayerStoRm open-source expert streaming: 1M context GLM-5.3-Flash [UD-Q4_K_XL] at 24.5 tok/s @8k on just 2× RTX 5090 + 2× RTX 5080 (186 GiB MoE on 96 GB VRAM)
핵심 요약
VRAM 용량을 초과하는 대형 MoE 모델을 시스템 RAM을 활용해 스트리밍 방식으로 구동하는 추론 엔진 LayerStoRm 소개.
- 전문가 스트리밍 — 모델 가중치를 시스템 RAM에 저장하고 필요할 때마다 GPU로 전송하여 VRAM 부족 문제 해결
- 고성능 추론 — 96GB VRAM 환경에서 186GB 규모의 MoE 모델을 24.5 tok/s 속도로 구동
- 에이전트 최적화 — 중간 프롬프트 체크포인트를 활용한 프리픽스 캐싱으로 대규모 컨텍스트 수정 시 재연산 시간 단축
- 하드웨어 요구사항 — NVIDIA SM120 아키텍처 지원 및 NUMA 인식 전송을 통한 대역폭 최적화
LayerStoRm: GLM-5.3-Flash UD-Q4_K_XL (186 GiB) 모델을 1M 컨텍스트에서 2× RTX 5090 + 2× RTX 5080 (총 96 GB VRAM) 조합으로 돌려봄. 고정된 전문가(pinned experts)는 RAM을 활용했음.
LayerStoRm은 (아직 실험 단계인) MIT 라이선스 기반의 연속 전문가 스트리밍 추론 엔진이야. VRAM보다 훨씬 큰 MoE 모델을 돌릴 수 있게 해주는데, 전문가 세트를 호스트 RAM에 박아두고 토큰마다 불러오는 방식이지. 여기서는 96 GB VRAM에 186 GB짜리 가중치를 올렸어 (호스트 RAM이 빡세게 일함: 이 모델을 위해 약 208 GB를 고정함).
측정 결과:
-
디코딩: 8k에서 24.5 tok/s, 0k에서 27.0 tok/s.
-
프리필: 27k에서 159 tok/s.
에이전트 코딩용으로 만들어서 미드 프롬프트 체크포인트를 활용한 프리픽스 캐싱을 지원해. 그래서 98% 지점에서 수정이 일어나도 처음부터 다시 돌릴 필요 없이 가장 가까운 체크포인트부터 프리필을 시작함. 덕분에 TTFT가 8k에서는 67.5s에서 18.4s로, 97k에서는 약 923s에서 79s로 줄어듦.
벤치마크를 돌린 장비는 512 GB DDR5에 64 GB HBM (Xeon Max) 사양이야. 근데 이 엔진 돌리려고 굳이 HBM이나 Xeon Max가 필요한 건 아님. CPU는 연산을 안 하거든. 그냥 전문가 데이터를 공급하는 역할만 하고, 모든 수학 연산은 GPU에서 처리함. 데이터 전송은 NUMA를 인식해서 멀티 소켓이나 멀티 NUMA 호스트라면 DDR 대역폭을 풀로 땡겨 쓸 수 있고, 결국 전송 속도는 PCIe 링크 속도에 제한됨.
명령어 한 줄로 모델 가중치랑 하드웨어 사양을 자동으로 인식해서 엔진을 설정하고 캘리브레이션까지 다 해줌. 파라미터가 왜 이렇게 잡혔는지 설명도 해주고. 다른 RTX 50 시리즈 조합도 잘 돌아갈 거야. 현재는 NVIDIA SM120만 지원함.

