DeepSeek V4 아키텍처에 대한 요약 및 토론
Takeaways & discussion about the DeepSeek V4 architecture
핵심 요약
DeepSeek V4의 하이브리드 어텐션과 매니폴드 제약 연결 등 혁신적인 아키텍처 분석 및 로컬 구동 가능성에 대한 논의.
- 하이브리드 어텐션 — CSA와 HCA를 결합하여 기존 어텐션 레이어를 유지하면서 효율성을 극대화함.
- 매니폴드 제약 연결 — 표준 잔차 연결을 대체하여 블록 간 정보 흐름을 개선하고 학습 안정성을 확보함.
- 로컬 실행 한계 — 엄청난 하드웨어 요구 사양으로 인해 일반적인 로컬 환경에서의 직접 구동은 사실상 불가능함.
- 커뮤니티 반응 — 아키텍처에 대한 기술적 토론과 함께 정보 출처의 신뢰성 문제로 인한 혼란이 발생함.
DeepSeek V4 기술 보고서를 아침 내내 살펴봤습니다. 벤치마크가 주목받고 있지만, 아키텍처도 파고들 가치가 있다고 생각합니다.
피드백과 토론을 장려하기 위해 간단한 생각을 적어봅니다.
TL;DR
- DeepSeek V3 대비 상당한 혁신
- 하이브리드 어텐션: Qwen3.5+, Mamba 등처럼 순수 MLA나 SSM/Gated DeltaNet을 사용하는 대신 CSA(압축 희소) + HCA(고압축) 사용
- 표준 잔차를 대체하는 매니폴드 제약 하이퍼 연결(원본 mHC 논문)
- 프런티어 규모에서의 FP4 QAT 학습
하이브리드 어텐션
CSA + HCA 접근 방식은 2차 어텐션 레이어를 선형 레이어로 대체하지 않는다는 점에서 흥미롭습니다. 대신 압축된(더 거친 입도의) 토큰 스트림에 슬라이딩 윈도우 어텐션 토큰을 결합하여 어텐션을 수행합니다. 즉, 모든 레이어가 여전히 어텐션 기반으로 유지되는데, 이는 기존 하이브리드 아키텍처와 비교했을 때 새로운 방향입니다.
잔차 스트림
표준 잔차 연결은 트랜스포머에서 거의 건드리지 않았던 부분입니다. V4는 매니폴드 제약 하이퍼 연결을 사용하여 블록 간 정보 흐름을 재설계했습니다. 제가 알기로는 DeepSeek가 학습 안정성 문제를 해결하고 이를 실제 프로덕션에 적용한 유일한 연구소입니다(틀렸다면 정정 부탁드립니다).
현실적으로 여기 있는 거의 아무도 DeepSeek V4를 로컬에서 돌릴 수 없을 겁니다. 최소한 최근 단종된 M3 Ultra 512GB 클러스터나, 그보다 더 비싼 NVIDIA 장비가 필요할 테니까요.
V4-Flash와 커뮤니티 증류 모델들이 나오면 이 릴리스가 로컬 추론 측면에서 더 흥미롭고 접근 가능해질 겁니다.
여러분의 생각은 어떤지 궁금합니다.


