DeepSeek V4 Flash 진짜 대박이네! (WIP llama.cpp PR #24162)
DeepSeek V4 Flash is amazing! (WIP llama.cpp PR #24162)
핵심 요약
DeepSeek V4 Flash 모델이 llama.cpp에서 초기 지원을 시작했으며, 뛰어난 지능과 효율성으로 로컬 LLM의 새로운 기준을 제시하고 있습니다.
- 모델 성능 — 동급 크기 대비 압도적인 지능과 효율성을 보여줌
- 하드웨어 요구사항 — 원활한 구동을 위해 상당한 VRAM과 DRAM 용량이 필요함
- 양자화 효율 — FP4-FP8 하이브리드 구조로 양자화 시 성능 저하가 적음
- 커뮤니티 기여 — llama.cpp PR을 통해 로컬 환경에서의 구동 가능성을 열어줌
혹시 아직 모르는 분들을 위해, DeepSeek V4 시리즈가 드디어 이 PR을 통해 llama.cpp에서 지원되기 시작했습니다!
이 PR은 아직 매우 초기 단계이므로, 호기심에 실험해 볼 의향이 있고 심각한 안정성/성능 저하를 감수할 수 있는 분들만 시도하세요. 매우 느리게 작동하며(5-6 tps), GPU 및 FA(Flash Attention) 지원 등은 아직 작업이 필요하지만, 정확도 면에서는 이미 충분히 신뢰할 만합니다.
제가 가장 기대하던 모델이라 시간을 내서 DS-V4-Flash의 HF 모델을 다운로드하고, PR을 사용해 직접 양자화해 봤습니다(전체 크기 모델의 텐서 레이아웃을 모방하기 위해 커스텀 3비트 양자화 적용). 그런데 와!
이 모델은 제 생각에 로컬 추론의 핵심인 세 가지 요소를 완벽하게 해결했습니다:
-
모델의 크기 대비 지능이 놀랍습니다. 이 정도 크기의 로컬 모델이 프론티어 모델과 비교할 만하다고 느껴진 건 처음인데, 과장이 아닙니다.
-
기본적으로 FP4-FP8 하이브리드 구조라 양자화에 훨씬 강합니다. 이는 로컬 배포에 매우 중요한데, MiniMax M2.7 같은 모델에서 UD-Q4_K_XL로도 만족하지 못했던 제 주된 불만이었습니다.
-
컨텍스트 윈도우 스케일링 효율이 엄청납니다. Flash Attention 없이도 KV 캐시 크기를 훨씬 적게 차지합니다!
Qwen 3.5/3.6 시리즈도 로컬 커뮤니티에서 위 세 가지 요소를 경쟁사보다 훨씬 잘 해결해서 큰 인기를 끌고 있죠. 하지만 DeepSeek 모델이 이를 한 단계 더 끌어올렸다고 생각하며, 앞으로 몇 달간 80-140GB 모델 시장을 쉽게 장악할 것이라 예상합니다.
DSA 구현을 위해 끊임없이 노력해 준 fairydreaming 님, 그리고 이 작업을 맡아준 am17an 님과 pwilkin 님께 큰 감사와 찬사를 보냅니다! 이 PR이 빨리 머지되기를 정말 기대합니다!

