MacBook 1대 vs DGX Spark 2대: DeepSeek-V4-Flash의 Terminal-Bench 2.1 결과는 54% 대 52%
One MacBook vs 2× DGX Spark: DeepSeek-V4-Flash scored 54% vs 52% on Terminal-Bench 2.1
핵심 요약
맥북의 고압축 모델과 DGX Spark의 네이티브 모델 간 성능 차이가 거의 없음을 확인한 흥미로운 벤치마크 결과입니다.
- 벤치마크 비교 — 맥북(M5 Max)과 DGX Spark 클러스터에서 동일한 모델의 성능을 측정함
- 성능 결과 — 고압축 GGUF 맥북(54%)과 네이티브 FP8/FP4 Spark(52%)의 점수가 거의 대등함
- 시스템 차이 — 맥북은 속도와 편의성은 떨어지지만, 압축을 통해 대규모 모델을 구동하는 능력이 뛰어남
- 추가 연구 — 작성자는 다른 모델들에 대한 추가 벤치마크 결과 공유를 예고함
TL;DR: DeepSeek-V4-Flash 모델을 가지고 89개 작업으로 구성된 Terminal-Bench 2.1 테스트를 돌려봤는데, 환경이 완전히 다른 두 곳에서 진행했음.
- 128GB M5 Max 맥북에서 80.8 GiB GGUF로 빡세게 양자화한 환경
- 2× DGX Spark에서 DSpark 추론 가속을 쓴 네이티브 FP8/FP4 체크포인트 환경
결과는 맥북이 47/87개 작업 성공(54%), 2-Spark 환경이 **45/86개 성공(52%)**이었음. 둘 다 채점된 86개 작업 중 66개는 결과가 같았고, 나머지 20개는 맥북이 11개, Spark가 9개 더 맞히면서 거의 반반 갈림.
2비트 양자화가 공짜라고 주장하려는 건 아님. 이건 그냥 한 번 돌려본 거고, 양자화만 딱 떼어놓고 비교한 게 아니라 시스템 전체를 비교한 거니까. 그래도 이 정도로 차이가 없다는 게 좀 놀랍긴 하네.
두 가지 환경
| Setup detail | MacBook | DGX Spark pair |
|---|---|---|
| Hardware | 1× M5 Max, 128 GB | 2× DGX Spark GB10, TP=2, direct CX7 200G link |
| Target model | DeepSeek-V4-Flash | DeepSeek-V4-Flash + DSpark draft module |
| Weights | 80.8 GiB mixed GGUF: IQ2_XXS/Q2_K experts, with important tensors kept at Q8/F16/F32 | Native mixed FP8 weights + FP4 routed experts |
| Approx. overall size | ~2.45 bits per weight | ~167 GB checkpoint |
| KV / context | on-disk KV, 100K advertised to the agent harness | nvfp4_ds_mla, 262K server window, 200K advertised to the harness |
| Runtime | DwarfStar (ds4-server, Metal) | patched vLLM build for GB10 (sm_121a) |
| Speculative decode | none in this run | DSpark, 3 draft tokens |
둘 다 같은 DeepSeek-V4-Flash 모델 계열을 쓴 건 맞는데, 스택 자체가 완전히 다름. 양자화 방식, 런타임, KV 포맷, 컨텍스트 제한, 하드웨어까지 싹 다 다르거든.
참고로 맥북 빌드를 그냥 "2비트"라고 부르는 건 좀 축약된 표현임. 라우팅된 전문가(routed-expert) 가중치 대부분은 2비트 근처지만, 어텐션이나 공유 전문가, 라우팅 같은 민감한 텐서들은 더 높은 정밀도를 유지함. 전체 파일 기준으로 계산하면 가중치당 대략 2.45비트 정도 됨.


