Deepseek v4 flash - prefill/pp 속도 100-150 t/s 향상
Deepseek v4 flash - 100-150 faster t/s in prefill/pp.
핵심 요약
DeepSeek v4 Flash의 prefill/PP 성능을 개선하기 위한 CUDA 버전 다운그레이드 및 코드 수정 방법 공유.
- 성능 최적화 — CUDA 13.3 대신 13.1 사용으로 prefill 속도 개선함.
- 코드 수정 — CUB_TOP_K_AVAILABLE 비활성화로 성능 저하 문제 해결함.
- 커뮤니티 협업 — 사용자 간의 패치 공유로 PP 속도 100-150 t/s 향상됨.
여기 두 가지 선택지가 있음 (우선순위 순):
-
CUDA를 13.3에서 13.1로 다운그레이드 (13.2는 버그 때문에 건너뜀) <- 이걸 더 추천함 (알려준 u/fairydreaming에게 감사)
-
CUDA 13.3에서 작동하는 이 vibed 포크 사용 https://github.com/vektorprime/working_ds4_speed
어제 nvidia profiler랑 LLM 도움을 받아서 트러블슈팅했음 (https://www.reddit.com/r/LocalLLaMA/comments/1vcs7bl/ds4_flash_full_model_in_offload_600_ts_pp_and/)
#1에 대한 추가 정보 (fairydreaming의 인용): "CUDA를 다운그레이드하고 다시 컴파일해라. 13.2부터는 argsort 대신 DeviceTopK가 사용되는데, 이게 PP 속도를 망친다."
요약하자면, DS4 Flash는 행렬 곱셈 외의 작업에 너무 많은 시간을 쓰고 있음.

