업데이트된 벤치마크: 로컬 환경에서의 Deepseek V4 Flash SlopCodeBench 결과
Updated benchmark: Deepseek V4 Flash on SlopCodeBench (local)
핵심 요약
Deepseek V4 Flash 모델을 로컬에서 양자화하여 벤치마크한 결과, 특정 환경에서 API보다 나은 성능을 보임.
- 벤치마크 업데이트 — Deepseek V4 Flash 모델의 로컬 양자화 성능을 측정함.
- 하네스 비교 — OpenCode 대신 Pi 하네스를 사용하여 성능 향상을 확인함.
- 로컬 vs API — 로컬 실행이 API보다 더 나은 결과를 보여주는 흥미로운 현상을 발견함.
- 성능 차이 — 맥북 M5 Max 환경에서 API보다 느리지만 지능 면에서 우위를 보임.
안녕하세요 - 여기에 벤치마크를 올렸습니다 - https://www.reddit.com/r/LocalLLaMA/comments/1vbtiy7/deepseek_v4_flash_on_slopcodebench/
이건 호스팅된 API를 사용한 것이었고, 그 이후로 양자화 모델들을 가지고 놀고 있습니다.
최신 벤치마크는 여기 있습니다 - https://github.com/michaelasper/benchmarks/blob/main/deepseek-v4-flash-0731-pi-on-slop-code-bench.md
이건 antirez q2-q4 imatrix 양자화를 사용했고, opencode에서 pi로 전환했습니다.
매우 흥미로운 결과입니다! 맥북 M5 Max에서는 호스팅된 API보다 훨씬 느리지만, 하네스를 바꾸니 손실된 지능의 일부를 만회할 수 있었습니다.
다른 보고된 실행 결과들과 비교
| Reported run | Serving | Harness | Strict | Isolated | Core |
| --- | --- | --- | --- | --- | --- |
| DeepSeek V4 Flash 0731 (run B) | local quant (antirez, higher cap) | pi 0.84.0 | 5/17 (29.4%) | 6/17 | 10/17 |
| Opus 5 | hosted API | Claude Code | 4/17 (23.5%) | — | — |
| DeepSeek V4 Flash | hosted API | OpenCode 1.18.10 | 3/17 (17.6%) | 6/17 | 11/17 |
| Opus 4.8 | hosted API | Claude Code | 1/17 (5.9%) | — | — |
| Sonnet 5 | hosted API | Claude Code | 1/17 (5.9%) | — | — |
| DeepSeek V4 Flash 0731 (run A) | local quant (unsloth, misconfigured cap) | pi 0.84.0 | 1/17 (5.9%) | 1/17 | 2/17 |

