DS4(DwarfStar)용 DeepSeek v4 Flash GGUF (DSpark MTP 헤드 포함)
DeepSeek v4 Flash for DS4 (DwarfStar) GGUF w/ DSpark MTP Head
핵심 요약
DS4 엔진 사용자를 위한 DeepSeek v4 Flash GGUF 양자화 모델 공유 및 성능 피드백 요청.
- DS4 엔진 최적화 — llama.cpp 대비 2배 빠른 속도 구현
- GGUF 모델 공유 — DSpark MTP 헤드가 포함된 새로운 체크포인트 배포
- 성능 피드백 요청 — CUDA/ROCm 환경 및 SSD 스트리밍 테스트 결과 수집
- 향후 업데이트 계획 — Q2/Q4 양자화 및 탈검열을 위한 스티어링 벡터 추가 예정
huggingface.co
원문 사이트로 이동
DeepSeek v4 Flash를 antirez의 DS4 DwarfStar 추론 엔진으로 열렬히 사용 중인데, 새 체크포인트가 나오자마자 바로 클라우드 박스를 빌려서 DS4 배포용으로 양자화를 진행했습니다. Unsloth에서 GGUF를 빠르게 내준 건 칭찬할 만하지만, 제 환경의 llama.cpp에서는 15 tok/sec 미만으로 돌아가더군요. 너무 느립니다.
DS4 전용 엔진은 제 MBP M5 Max에서 그 두 배인 30 tok/sec 이상으로 돌아갑니다. 에이전트 워크플로우에 실제로 쓸 수 있는 속도죠. 어쨌든, antirez의 정확한 Q2-Q4 혼합 imatrix 양자화 레시피를 사용해 새 체크포인트를 양자화했고, DSpark 헤드는 따로 분리해서 사람들이 실험해 볼 수 있도록 별도의 GGUF로 만들었습니다. 이 서브레딧에서 DS4를 사용하는 분들이 테스트를 도와주시면 정말 감사하겠습니다. 작동은 하지만, 반복 작업을 통해 개선할 수 있도록 프리뷰 대비 성능에 대한 피드백이 필요합니다.
레포 링크는 여기 있습니다. 추가 양자화(Q2_K & Q4_K, MTP 헤드 포함)와 더 나은 imatrix, 그리고 DS4의 매력적인 스티어링 기능을 활용해 모델을 탈검열(de-censor)할 수 있는 커스텀 방향 스티어링 abliteration 벡터 파일도 계획 중입니다.
CUDA/ROCm 사용자들의 보고(저는 Metal만 테스트 가능합니다), tok/sec 디코드 및 프리필 성능, MTP 성능 보고(하루 종일 양자화하느라 아직 A/B 테스트를 못 해봤습니다), 그리고 SSD 스트리밍 사용자들의 피드백을 기다립니다.
DS4가 처음이라면 60초 만에 설정할 수 있습니다. llama.cpp 대비 2배 속도로 모델을 사용할 수 있고, SSD에 영구적인 KV 캐시를 저장하며, OpenAI API 엔드포인트를 통해 원하는 코딩 하네스를 사용할 수 있습니다. 한번 시도해 보세요.
모든 피드백에 정말 감사드리며, 벤치마크를 제공해 주시면 모델 카드에 기꺼이 크레딧을 기재하겠습니다. 또한 DS4를 처음 접하는 사용자를 위해 모델 카드를 개선할 방법이 있다면 의견 부탁드립니다. 이 프로젝트를 정말 좋아해서 기여하고 싶었습니다! 미리 감사드립니다.


