DeepSeek-V4-Flash-0731 - 의외로 쓸만함
deepseek-v4-flash-0731 - surprisingly usable
핵심 요약
Epyc CPU와 RTX 5090을 활용한 로컬 추론 환경에서 DeepSeek 모델의 성능을 공유하고 최적화 팁을 구하는 글입니다.
- 하드웨어 구성 — Epyc 7663 CPU와 256GB RAM, RTX 5090 32GB 조합으로 로컬 추론 환경 구축함
- 추론 성능 — UD-Q8_K_XL 양자화 모델로 초당 23~24 토큰 속도를 기록함
- 병목 현상 — 프롬프트 처리(PP) 속도가 다소 느리지만 일반적인 대화나 계획 수립 용도로는 충분히 사용 가능함
- 최적화 논의 — 램 오프로드와 양자화 설정, 워밍업 등을 통해 성능을 개선할 여지가 있음
방금 내 (나름) 저가형 로컬 추론 머신 조립을 끝냈다:
-
Epyc 7663
-
256GB ECC DDR4-3200
-
1x RTX 5090 32GB
5090에 256GB 램 박아놓고 저가형이라고 부르는 게 좀 웃기긴 한데, 가중치 151GB 정도 되는 모델 돌리는 거 생각하면 뭐 저가형 맞지.
지금 UD-Q8_K_XL 돌리고 있는데 23.8~24.6 tokens/sec 정도 나온다. 100~128k 컨텍스트 쓰는 작업에서 첫 프롬프트는 pp 60, 마지막쯤엔 385까지 찍히네(캐싱 덕분인 듯). DFlash 썼을 땐 더 느려져서 뺐고, 잠깐 꽂아봤던 3090 쓸 때보다도 지금이 더 빠름.
이 글 올리는 이유는 이런 구성(DDR4 Epyc + Blackwell 조합으로 CPU-MoE 돌리는 거)에 대한 데이터가 별로 없어서 공유하려고. 그리고 1만 달러씩 꼴아박거나 지하실에 서브 패널 따로 안 깔아도 이 정도 성능 나오는 모델을 집에서 돌릴 수 있다는 게 좀 놀라워서 적어봄. 이쪽은 이제 막 시작한 뉴비라, 또 뭐 돌려볼 만한 거나 성능 더 뽑아낼 팁 있으면 좀 알려줘라.

