DeepSeek V4 Flash, AMD Ryzen AI MAX+ 395에서 최대 32 tok/s 달성
DeepSeek V4 Flash, up to 32 tok/s on AMD Ryzen AI MAX+ 395
핵심 요약
Ryzen AI MAX+ 395에서 DeepSeek V4 Flash를 구동하여 32 tok/s의 실사용 가능한 속도를 구현했습니다.
- 성능 최적화 — ROCmFPX 포맷을 활용해 284B 파라미터 모델을 128GB 메모리에 최적화함
- 속도 향상 — DSpark 드래프트 모델을 사용하여 기존 대비 2배 이상의 추론 속도 달성
- 희소 프리필 — Sparse prefill 기술을 통해 초당 약 250 토큰의 빠른 프리필 속도 구현
- 오픈 소스 — 관련 코드와 구현 방식을 GitHub를 통해 공개함
안녕 라마들아. Strix Halo 쓰는 형들을 위해 유용한 정보를 하나 가져왔어. 짧게 핵심만 말할게.
우리가 Ryzen AI MAX+ 395(통합 메모리 128GB) 한 대에 DeepSeek V4 Flash랑 그 추론용 draft 모델을 다 집어넣고, 실사용 가능한 수준의 디코드 속도까지 뽑아냈거든.
자세한 내용은 여기 블로그 포스트 참고해: https://www.lucebox.com/blog/deepseek-v4-strix-halo (코드는 오픈소스고 Apache-2.0 라이선스야)
우리가 이 결과를 LocalMaxxing에 올렸거든. 7월 25일 기준으로 Radeon 8060S에서 가장 빨랐던 DeepSeek V4 Flash 기록이 HipFire의 18.99 tok/s였어. 그리고 사이트 내 Ryzen AI Max 395 통합 메모리 그룹에서 기존 1등은 DwarfStar의 15.6 tok/s였지.
결과적으로 우리 기록은 HipFire보다 68.5% 빠르고, DwarfStar보다는 2.05배나 더 빨라. 이건 위에서 말한 LocalMaxxing에 올라온 공개 기록이랑 비교한 거지, 통제된 A/B 테스트 결과는 아니야.
ROCmFPX: 284B 파라미터를 128GB에 구겨 넣기
ROCmFPX는 그냥 양자화 포맷 하나가 아니야. AMD ROCm/HIP 경로를 기반으로 하는 블록 포맷 패밀리지. 각 블록은 32개의 가중치를 압축된 저비트 코드로 담고, 여기에 1~2개의 작은 스케일 값을 붙여. ROCmFP2는 블록당 10바이트(가중치당 2.50비트), ROCmFP3는 3.50비트, 그리고 빠른 ROCmFP4 레이아웃은 4.25비트를 써.
DeepSeek V4 Flash를 위해 우리는 빠져있던 2비트 포맷이랑 HIP 커널을 직접 추가했고, Strix에 최적화된 혼합 정밀도 레시피를 짰어. 엄청나게 큰 routed-expert 게이트랑 up 행렬은 ROCmFP2를 쓰고, expert down 프로젝션은 ROCmFP3, 그리고 dense나 좀 민감한 프로젝션은 ROCmFP4 이상의 정밀도를 유지했지. 양자화 과정에서 중요도 행렬(importance matrix)을 썼고 모델의 MTP 헤드는 그대로 살렸어. 최종 102.3GB짜리 타겟은 대략 파라미터당 2.88비트 정도 돼. 파일 이름이 ROCmFP2인 건 그게 주력 포맷이라 그런 거지, 모든 텐서가 2비트라는 뜻은 아니야.
| Piece | Measured configuration |
|---|---|
| Hardware | Ryzen AI MAX+ 395, Radeon 8060S (gfx1151), 128 GB LPDDR5X |
| Target | DeepSeek-V4-Flash-ROCMFP2-STRIX.gguf, 102.3 GB |
| Draft | DeepSeek-V4-Flash-DSpark-draft-Q4RMFP4-denseF16.gguf, 11.3 GB |
| Runtime | ROCm 7.2.4, HIP , platform , Radeon (2.9 GHz observed), q=4 verification cap |
