Deepseek V4.1 Flash는 552B가 아니라 748B임
Deepseek V4.1 Flash is 748B, not 552B
핵심 요약
Deepseek V4.1 Flash의 실제 파라미터 규모와 구성 요소를 분석하고, 이를 구동하기 위한 하드웨어 요구 사항을 논의함.
- 파라미터 분석 — 메인 모델 551.5B에 engram, DSpark, 비전 인코더 등을 합치면 748B 규모임
- 하드웨어 요구 사항 — 128GB~256GB 이상의 RAM/VRAM이 필요하며 일반적인 환경에서는 구동이 어려움
- engram 활용 — SSD를 통한 오프로딩 가능 여부와 추론 엔진 최적화가 주요 쟁점으로 떠오름
- 추론 효율성 — Deepseek는 총 파라미터보다 활성 파라미터 수를 줄여 추론 효율을 극대화하는 데 집중함
다들 자꾸 헷갈려 하길래 내가 직접 hf에 올라온 safetensors 뜯어봤다.
제목을 "Deepseek V4.1 Flash는 총 748B/베이스 552B임, 284B나 305B, 485B, 522B 아님"으로 박았어야 했다.
-
이 모델 284B 아니다. 오리지널 Deepseek V4 Flash가 284B인 거지, V4.1 Flash 모델은 아니라고.
-
이 모델 305B도 아니다. 누가 뭐라 하든 간에
"So: ~305B real backbone + 203B engram = 508B total"이딴 소리는 틀린 말임. -
이 모델 485B도 아니다. Huggingface에 485B라고 적혀 있긴 한데, 그건 FP4 패킹된 가중치를 파라미터가 아니라 바이트로 계산해서 그런 거임(바이트당 FP4 파라미터 2개니까). 이런 일 존나 흔함. 예를 들어 Huggingface는 여기서 GLM-5.3-flash를 169b라고 잘못 표기함.
-
이 모델 522B도 아니다. VLLM에서 무슨 이유인지 522B라고 적어놨는데, 그 페이지 아래쪽 보면 지들도 정정해놨음(vllm 페이지에서 "Params" 검색해 봐라).
-
552B가 그나마 이 리스트 중에서 맞는 숫자인데, 이것도 MTP랑 engram, 비전 인코더 뺀 베이스 모델만 계산한 거임.
정확히 말하자면 메인 모델은 40개 레이어에 파라미터가 약 551.566B 정도 된다. FFN 전문가 모델이 총 543.582B고, 나머지(어텐션, 공유 전문가 등)가 7.984B임.
거기에 engram이 약 196.929B, DSpark/MTP가 약 14.225B, 비전 인코더가 겨우 0.485B 정도 추가됨. 물론 얘네는 엄밀히 따지면 옵션이긴 한데, 비전 인코더는 생각보다 훨씬 작네.
어쨌든 이거 돌리려면 사양 존나 좋아야 한다. 128GB나 256GB RAM/VRAM으로는 택도 없음.
| Component | Logical params | Size in GB | Storage |
|---|---|---|---|
| FFN MoE experts | 543.582B | 288.778 GB | FP4 |
| Other FFN | 1.4947B | 1.574 GB | FP8 mostly |
| Attention | 5.1269B | 6.524 GB | FP8 mostly |
| Embedding + LM head | 1.3238B | 2.648 GB | BF16 |
| Other | 0.0397B | 0.158 GB |

