DeepSeek, 2T 파라미터 모델 훈련 중이며 8T 모델까지 계획 중
Deepseek training 2T and plans 8T model
핵심 요약
DeepSeek이 2T 파라미터 모델을 훈련 중이며 향후 8T 모델까지 개발할 계획이라는 소식에 커뮤니티가 모델 규모와 실현 가능성을 두고 토론하고 있습니다.
- 모델 규모 확장 — DeepSeek이 2T 및 8T 파라미터 모델 개발을 추진함
- 기술적 회의론 — 모델이 커질수록 일반화가 어렵고 암기 위주가 될 것이라는 우려 제기됨
- 추론 성능 의문 — 1T 활성 파라미터 모델의 실현 가능성과 서비스 속도에 대한 논쟁 발생
- 데이터 출처 논란 — 비공개 모델의 파라미터 수치에 대한 신뢰성 문제 제기됨
DeepSeek는 현재 2T 파라미터 모델을 훈련 중이고, 나중에는 8T 파라미터 모델까지 만들 계획임.
https://x.com/wallstengine/status/2101982843656388644
현재 DeepSeek 모델 현황:
-
Flash 파라미터 수: 5520억 (552 billion)
-
Pro: 총 파라미터 1.6T (1.6조), 토큰당 활성화 가중치 49B (490억)
Mythos / Fable은 파라미터 수가 10T 정도로 추정됨.


