Deepseek V4 Flash 2비트 양자화 모델, 로컬에서 SQL 벤치마크 100% 달성
Deepseek V4 Flash 2-bit quant is the first model I can run locally that achieves 100% in this SQL benchmark
핵심 요약
Deepseek V4 Flash 2비트 양자화 모델이 로컬 환경에서 SQL 벤치마크 만점을 기록하며 뛰어난 성능을 입증했습니다.
- 성능 기록 — Deepseek V4 Flash 2비트 모델이 SQL 벤치마크에서 100% 정답률을 달성함
- 하드웨어 구성 — 듀얼 RTX 3080 20GB GPU와 96GB RAM 환경에서 구동됨
- 최적화 기법 — 커스텀 IQ2_M GGUF와 수정된 ds4 엔진을 사용하여 추론 속도를 개선함
- 비교 결과 — 기존 모델들과 비교했을 때 압도적인 추론 능력을 보여줌
나는 새로운 모델을 테스트할 때 이 SQL 벤치마크를 사용하는 걸 정말 좋아해. 얼마 전에 내 벤치마크 결과를 올린 적이 있는데, Deepseek가 너무 잘해서 새로운 글을 쓰기로 했어. 이 벤치마크는 실행이 빠르고 꽤 "실제 상황"과 비슷하며, 올바른 SQL 쿼리를 작성하려면 좋은 추론 능력이 필요해서 좋아해. 거의 어떤 프론티어 모델도 100%를 달성하지 못하거든.
내 예전 글: https://www.reddit.com/r/LocalLLaMA/comments/1s9mkm1/benchmarked_18_models_that_i_can_run_on_my_rtx/
다른 모델들의 결과가 포함된 벤치마크: https://sql-benchmark.nicklothian.com https://github.com/nlothian/llm-sql-benchmark
내 설정은 듀얼 3080 20GB GPU에 96GB RAM, 9800X3D야. antirez GGUF에서 텐서 일부를 이식한 커스텀 IQ2_M GGUF를 사용하고, antirez의 수정된 ds4 엔진에서 실행해서 300pp와 11-12tg를 얻었어. 메인라인 llama.cpp는 100pp와 8tg 정도밖에 안 나오더라고.
놀랍게도 Deepseek는 내가 실제로 로컬에서 돌릴 수 있는 모델 중 모든 테스트를 올바르게 수행한 첫 번째 모델이야. 벤치마크 웹사이트에 따르면 이 작업을 수행할 수 있었던 유일한 모델은 Opus 4.7과 GPT-5.5뿐이었어.
내 예전 벤치마크들과 함께 정리한 결과:
25: Deepseek-v4-Flash-IQ2_M-grafted 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩
24: unsloth/Qwen3.6-27B-MTP-GGUF:Q8_0 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟥🟩🟩
24: unsloth/Qwen3.5-122B-A10B-GGUF:UD-Q4_K_XL 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟥🟩 🟩🟩🟩🟩🟩
23: unsloth/Qwen3.5-122B-A10B-GGUF:Q6_K 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟥🟩 🟥🟩🟩🟩🟩
23: unsloth/Qwen3.5-27B-MTP-GGUF:UD-Q6_K_XL 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟥🟩 🟥🟩🟩🟩🟩
23: DavidAU/Qwen3.6-40B-Claude-4.6-Opus-Deckard-Heretic-Uncensored-Thinking-NEO-CODE-Di-IMatrix-MAX-GGUF:Q4_K_M 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟥🟩🟩 🟩🟩🟩🟥🟩 🟩🟩🟩🟩🟩
23: unsloth/Qwen3.6-35B-A3B-GGUF:UD-Q8_K_XL 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟥🟩🟩 🟩🟩🟩🟥🟩 🟩🟩🟩🟩🟩
23: bartowski/Qwen_Qwen3.5-27B-GGUF:IQ4_XS 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟥🟩 🟥🟩🟩🟩🟩
23: bartowski/Qwen_Qwen3.5-27B-GGUF:IQ3_XS 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟥🟩 🟥🟩🟩🟩🟩
23: unsloth/Qwen3.5-122B-A10B-GGUF:UD-IQ3_XXS 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟥🟩 🟥🟩🟩🟩🟩
23: h34v7/Jackrong-Qwopus3.5-27B-v3-GGUF:Q3_K_M 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟥🟩 🟥🟩🟩🟩🟩
22: unsloth/Qwen3.5-35B-A3B-GGUF:UD-Q6_K_XL 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟥🟩🟩 🟩🟩🟩🟥🟩 🟥🟩🟩🟩🟩
22: mradermacher/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-i1-GGUF:Q3_K_M 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟥🟩🟥🟩 🟥🟩🟩🟩🟩
22: Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF:Q4_K_M 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟥🟥🟩 🟥🟩🟩🟩🟩
21: unsloth/Qwen3.6-27B-MTP-GGUF:UD-Q6_K_XL 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟥🟩🟩🟩 🟩🟩🟩🟥🟩 🟩🟨🟥🟩🟩
21: unsloth/MiniMax-M2.7-GGUF:UD-IQ3_XXS 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟥🟩 🟥🟥🟥🟩🟩
21: unsloth/NVIDIA-Nemotron-3-Super-120B-A12B-GGUF:UD-Q4_K_S 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟩🟩🟩🟨🟥 🟥🟨🟩🟩🟩
20: unsloth/Qwen3-Coder-Next-GGUF:UD-Q5_K_XL 🟩🟩🟩🟩🟨 🟩🟩🟩🟩🟩 🟩🟩🟨🟩🟩 🟩🟩🟩🟥🟨 🟥🟩🟩🟩🟩
20: unsloth/gemma-4-31B-it-qat-GGUF:UD-Q4_K_XL 🟩🟩🟩🟩🟩 🟩🟩🟩🟩🟩 🟥🟩🟩🟩…


