Deepseek V4 Flash 0731 vs GLM5.3 Flash (2x DGX Spark 환경) HumanEval 벤치마크
Humaneval benchmark for Deepseek V4 Flash 0731 vs GLM5.3 Flash on 2x DGX Spark setup
핵심 요약
2x DGX Spark 환경에서 Deepseek V4와 GLM 5.3 Flash의 성능을 비교한 벤치마크 결과입니다.
- 성능 비교 — GLM 5.3 Flash가 Thinking 모드에서 더 높은 HumanEval 점수를 기록함
- 하드웨어 제약 — GLM 5.3 Flash는 256k 컨텍스트 제한이 있어 고용량 VRAM 환경이 유리함
- 양자화 논쟁 — NVFP4 양자화 모델의 성능 저하 우려와 실사용 환경에서의 차이에 대한 의견 교환
- 추가 요청 — EXL3 양자화 방식과의 비교 및 동일 VRAM 조건에서의 테스트 제안
최근에 DGX Spark 2개 세팅해서 Deepseek V4 Flash 0731 아주 잘 돌리고 있었거든. 이번 주에 GLM5.3 Flash랑 Qwen 3.8 Flash Next 나오면서 다들 자기 하드웨어 상황에서 뭘 돌려야 할지 눈치 싸움 중이잖아. 나도 GLM 모델 로컬에서 돌려보고 싶어서 nvfp4가 내 세팅에 딱일 것 같았는데, GLM5.3 Flash nvfp4 양자화에 대해 하도 말이 많고 부정적인 의견이 많아서 좀 멈칫했음. 그래서 그냥 직접 간단하게 벤치마크 돌려봤고, 나랑 비슷한 세팅 쓰는 형들한테 도움 됐으면 좋겠다.
Deepseek V4 Flash 0731 recipe : official checkpoint, fp8 kv, 1M context, 4 concurrent streams
GLM 5.3 Flash recipe : NVFP4 quant & Dflash2 drafter, fp8_e4m3 kv, 256k context, 6C
| Model | Thinking Mode | HumanEval Pass@1 (Base) | HumanEval+ (Adversarial Edge Cases) | Total Benchmark Run Time | Local Stream Speed |
|---|---|---|---|---|---|
| GLM-5.3-Flash NVFP4 | Thinking Enabled (high) | 97.0% (159 / 164) | 92.1% (151 / 164) | 20m 52s | ~50 tok/s (DFlash2) |
| DeepSeek-V4-Flash-0731 | Thinking Enabled (high) | 94.5% (155 / 164) | 88.4% (145 / 164) | 38m 16s | ~70 tok/s (MTP-5) |


