M3 Max 96GB 맥에서 Deepseek 4 flash 구동하기
You can run Deepseek 4 flash on mac (M3 Max, 96gb)
핵심 요약
M3 Max 맥에서 Deepseek 4 flash를 구동하는 방법과 성능을 공유함.
- 구동 엔진 — antirez의 ds4 엔진과 GGUF 모델 사용
- 성능 최적화 — SSD 스트리밍 및 Metal 할당량 조정 적용
- 실제 성능 — 초당 11~13 토큰 속도로 구동 가능
오늘까지 이게 실제로 가능한 줄 몰랐음. https://github.com/antirez/ds4#running-models-larger-than-ram Antirez의 특정 엔진과 그가 만든 ds4 gguf를 사용하니까 그냥 바로 돌아감.
다음 옵션을 전달해야 함:
--ssd-streaming
128GB 미만일 경우 실행 시 필요함. 64GB 이상이면 적당한 듯. 나도 다음을 전달했음:
iogpu.wired_limit_mb=86016
사용 가능한 Metal 할당량을 늘리기 위해서임. 그 다음 레포 자체를 패치해서 캐시 안전성을 0.70으로 높이면 VRAM에 얼마나 많은 전문가(experts)가 로드되는지 테스트해 볼 수 있음.
선택 사항으로 간단한 메뉴 바 .app 데몬을 만들어서 Spotlight에서 바로 서버를 실행할 수 있게 했음. 20분 정도 걸림.
0614 15:50:38 ds4-server: chat ctx=140..190:50 gen=50 decoding chunk=11.72 t/s avg=11.72 t/s 4.268s 0614 15:50:42 ds4-server: chat ctx=190..240:50 gen=100 decoding chunk=13.31 t/s avg=12.46 t/s 8.025s 0614 15:50:46 ds4-server: chat ctx=240..290:50 gen=150 decoding chunk=12.88 t/s avg=12.60 t/s 11.907s 0614 15:50:46 ds4-server: chat ctx=290..300:10 gen=160 decoding chunk=13.53 t/s avg=12.65 t/s 12.647s
Prefill / 시간:
내 M3 Max 96GB에서 약 11-13tk/s 정도 나옴. 콜드 부팅 시 빈 Jan 어시스턴트 채팅에서 약 10초 걸림. 그 후에는 ~3-5s TTFT.
아쉽게도 프리필(prefill)이 길어지면 답답해서 코딩에 이걸 쓸지는 잘 모르겠음. 36k 토큰 처리하는 데 2분 30초 정도 걸림. 하지만 일단 캐시에 올라가면 12tk/s 정도를 유지함.
어쨌든, 이미 다들 아는 내용일 수도 있지만 이게 가능할 줄은 몰랐음.. Qwen 27b보다 그렇게 많이 느린 것도 아님. 벤치마크 결과가 어떻게 나올지는 모르겠지만, 당연히 모델 크기는 훨씬 큼.

