5.3GB 메모리로 구동하는 DeepSeek-V4-Flash 284B
DeepSeek-V4-Flash 284B on 5.3GB of memory
핵심 요약
SSD 스트리밍을 활용해 거대 MoE 모델을 저사양 환경에서 구동하는 Mference 엔진 소개.
- Mference 엔진 — MoE 모델의 핵심 가중치만 메모리에 올리고 나머지는 SSD에서 스트리밍함
- 모델 지원 — Gemma 4, Qwen 3.6 및 DeepSeek-V4-Flash 등 다양한 모델 구동 가능
- 성능 최적화 — 24GB 메모리 환경에서 284B 모델을 5.3GB 점유로 구동 및 초당 4.8 토큰 처리
- 향후 계획 — 모델 패밀리 확장 및 I/O 병목 개선, 컨텍스트 윈도우 4K 이상으로 확대
제 Qwen 3.6 포트 작업에 이어, 모델을 계속 추가하고 싶었고 그 과정에서 여러 가지를 수정하다 보니 이제는 독자적인 엔진이 되었습니다: Mference.
TurboFieldfare와 핵심 아이디어는 같습니다. MoE 모델은 토큰당 몇 개의 B 파라미터만 활성화하므로, 공유 코어와 KV 캐시는 메모리에 상주시키고 선택된 전문가 모델은 SSD에서 스트리밍하는 방식입니다.
현재 구동 가능한 모델:
- Gemma 4 26B-A4B — 약 2GB, 24GB M5 Pro에서 31–35 tok/s
- Qwen 3.6 35B-A3B — 약 1.45GB, 19–23 tok/s
- DeepSeek-V4-Flash 284B-A13B — 신규. 피크 메모리 약 6.8GB, 실제로는 대부분 5.3GB 점유, 동일한 24GB M5에서 최대 4.8 tok/s. 2비트 동적 양자화, 디스크 용량 약 91GB.
또한 다중 턴 채팅이 가능한 네이티브 Mac 앱, OpenAI 호환 서버, 그리고 로컬 PDF/DOCX/PPTX/XLSX 첨부 기능도 추가했습니다.
앞으로는 모델 패밀리를 계속 추가하고, 전문가 모델 읽기 대기 시간을 줄이며(현재 디코딩은 연산과 직렬화된 I/O가 약 53%를 차지함), 컨텍스트를 4K 이상으로 늘릴 계획입니다.
몇 번의 대화 이상으로는 별로 유용하지 않지만, 기술적으로는 8GB Mac에서도 dsv4f를 "사용 가능한" 수준으로 돌릴 수 있습니다. 앞으로 더 좋아질 일만 남았습니다.


