DeepSeek V4.1 Flash: 더 강력하고, 빠르고, 접근성 높은 모델 출시
DeepSeek V4.1 Flash: Stronger, Faster, More Accessible
핵심 요약
DeepSeek이 비대칭 아키텍처와 KV 캐시 압축을 통해 성능과 효율을 극대화한 V4.1 Flash 모델을 공개했습니다.
- 비대칭 아키텍처 — 입력 8B, 출력 16B 활성화로 비용 효율성 극대화
- KV 캐시 최적화 — 이전 세대 대비 HBM 요구량 1/4, SSD 요구량 1/8로 감소
- API 및 가격 — V4 Pro를 대체하며 피크/오프피크 차등 요금제 적용
- 오픈소스 지원 — 모델 가중치 공개 및 대규모 배포 환경 지원
DeepSeek 위챗 공식 계정 원문: https://mp.weixin.qq.com/s/qg0NU3NNUbp1co2PdkAPAg
오늘 DeepSeek V4.1 Flash 모델을 공식 출시한다. 이건 우리가 새로 만든 모델 아키텍처 시리즈 중 가장 작은 모델인데, 네이티브 멀티모달 시각 이해 능력을 갖췄다. 이번 새 아키텍처는 더 높은 성능 한계치, 빠른 추론 속도, 더 큰 처리량, 그리고 더 큰 파라미터 모델로의 확장성을 목표로 설계됐다.
비대칭 아키텍처: 저비용 고지능
DeepSeek V4.1 Flash는 완전히 새로운 Causal-Encoder-Decoder 아키텍처를 기반으로 만든 552B 파라미터 MoE 모델이다. 입력과 출력이 비대칭인데, 입력 쪽은 8B 파라미터만 활성화되고 출력 쪽은 16B만 활성화돼서 비슷한 크기의 기존 모델들보다 훨씬 싸게 먹힌다. V4.1 Flash는 새로운 사전 학습 방식을 썼고, 더 대규모의 강화 학습 사후 학습까지 거쳤다. 벤치마크 테스트를 해보니까 DeepSeek V4 Pro를 포함한 여러 플래그십 모델들의 지능 수준을 가볍게 뛰어넘더라.
캐시 줄이고 비용 낮추고
이번 신형 모델은 KV 캐시 크기를 엄청나게 줄였다. 이전 세대랑 비교하면 HBM 요구량은 1/4, SSD 요구량은 1/8로 줄어들었다. 에이전트 작업할 때 캐시 히트 비용이 청구서에서 꽤 큰 비중을 차지하는데, KV 캐시를 압축해서 에이전트 스타일 작업 비용을 확 낮췄다.






