DeepSeek V4 Pro의 지능 밀도 감소
Decreased Intelligence Density in DeepSeek V4 Pro
핵심 요약
DeepSeek V4 Pro가 V3.2 대비 모델 크기는 커졌으나 토큰 효율성과 지능 밀도는 오히려 퇴보했다는 지적입니다.
- 토큰 효율성 저하 — V4 Pro가 V3.2보다 더 많은 토큰을 소모하며 지능 밀도가 낮아짐.
- 모델 크기 증가 — 1.6T 파라미터로 V3.2 대비 2.5배 커졌으나 성능 효율은 오히려 퇴보함.
- 학습 부족 의혹 — 커뮤니티에서는 모델이 아직 덜 학습된 상태로 조기 출시된 것으로 추측함.
- 경쟁 모델 비교 — GPT-5.5 등 타 모델 대비 토큰 효율성이 현저히 떨어져 작업 완료 시간이 길어짐.
V3.2 논문에서 그들은 이렇게 언급했음:
둘째, 토큰 효율성은 여전히 과제임. DeepSeek-V3.2는 Gemini 3.0-Pro 같은 모델의 출력 품질을 따라잡기 위해 보통 더 긴 생성 궤적(즉, 더 많은 토큰)을 필요로 함. 향후 연구는 효율성을 개선하기 위해 모델 추론 체인의 지능 밀도를 최적화하는 데 집중할 것임.
하지만 V4 Pro에서는 상황이 더 악화된 것으로 보임. 생각하는 모드(non-thinking mode)조차 V3.2보다 훨씬 더 많은 토큰을 사용하고, V4 Pro(1.6T)는 V3.2(0.67T)보다 대략 2.5배 더 큼. 이는 모델의 지능 밀도가 개선되기는커녕 오히려 감소했음을 시사함!
GPT-5.4 및 GPT-5.5와 비교하면 그 격차는 더 커짐. DeepSeek는 비슷한 성능을 내기 위해 약 10배 더 많은 토큰이 필요한 것으로 보임. 동일한 TPS를 가정하면, 이는 DeepSeek V4 Pro가 같은 작업을 완료하는 데 대략 10배 더 오래 걸린다는 것을 의미함.


