DeepSeek V4 Pro, 에이전트 벤치마크에서 GPT-5.2와 대등한 성능 기록 — 10주 만에 추격, 비용은 약 17배 저렴
DeepSeek V4 Pro matches GPT-5.2 on FoodTruck Bench, our agentic benchmark — 10 weeks later, ~17× cheaper
핵심 요약
DeepSeek V4 Pro가 에이전트 벤치마크에서 GPT-5.2급 성능을 보이면서도 비용은 17배 저렴하다는 분석 결과가 나왔습니다.
- DeepSeek V4 Pro — GPT-5.2 출시 10주 만에 성능 격차를 3% 이내로 좁히며 프런티어 급에 진입함.
- 압도적 가성비 — 동일한 에이전트 작업 부하에서 GPT-5.2 대비 약 17배 저렴한 비용 효율성을 보여줌.
- Gemma 4 31B — 프리미엄 모델들을 제치고 비용 대비 효율성 부문에서 전체 1위를 차지함.
- 중국 모델의 약진 — DeepSeek와 Xiaomi MiMo가 Top 6에 진입하며 미국 모델들과의 격차를 빠르게 좁힘.
FoodTruck Bench에서 DeepSeek V4 Pro를 테스트했습니다 — 34개의 도구(위치, 가격, 재고, 직원, 날씨, 이벤트)를 통해 푸드트럭을 운영하며 영구 메모리와 일일 회고 기능을 사용하는 30일간의 에이전트 벤치마크입니다.
우리 벤치마크에서 프런티어 티어에 진입한 첫 번째 중국 모델입니다. 결과 면에서 Grok 4.3 Latest와 동점을 기록했으며, GPT-5.2 중앙값의 3% 이내로 접근하여 Opus 4.6, GPT-5.2, Grok 4.3에 이어 종합 4위를 차지했습니다.
흥미로운 부분은 타이밍입니다. 우리는 2월 중순에 GPT-5.2를 테스트했습니다. DeepSeek V4 Pro는 10주 만에 그 수치에 도달했습니다. 이 벤치마크에서 중국과 미국 프런티어 모델 간의 격차는 예전에 1년 정도로 느껴졌습니다. 현재는 약 10주 정도입니다.
가격 격차는 훨씬 더 극명합니다. GPT-5.2는 입력 100만 토큰당 $1.75, 출력 100만 토큰당 $14를 부과합니다. DeepSeek V4 Pro는 입력 $0.435, 출력 $0.87이며 여기에 캐시 읽기 할인까지 추가됩니다 — ~17× cheaper for the same agentic workload. 현재는 프로모션 가격이지만, DeepSeek의 전례를 보면 프로모션 가격이 곧 기본 가격이 됩니다.
비용 효율성(API 지출 1달러당 순자산) 측면에서 DeepSeek V4 Pro는 리더보드 전체 2위입니다 — Gemma 4 31B에만 뒤처지며, 모든 프리미엄 티어 모델보다 앞서 있습니다.
특히 Grok 4.3 Latest와 비교했을 때 중앙값은 동일한 가격대에서 기본적으로 동점이지만, DeepSeek은 일관성에서 승리했습니다: 대출 0건, ~6× less food waste, 30% more meals served per day, 2.4× tighter outcome distribution. Grok은 DeepSeek의 최고점에 도달할 수 있지만, DeepSeek은 매번 자신의 최고점을 찍습니다.
Opus 4.6의 최고 기록은 여전히 DeepSeek보다 높습니다. Gemma는 여전히 더 저렴합니다. 그 외에는 중국산 가격대의 진정한 프런티어 티어 경쟁자입니다.
Update — Xiaomi MiMo v2.5 Pro just finished its run set as well:
5/5 survived, +1,019% median ROI, $22,388 median net worth at $2.41/run.
Lands at #6 on the leaderboard, between Gemma 4 31B and Sonnet 4.6. Slightly behind DeepSeek on outcome and consistency (wider variance — $9K worst run vs $29K best), but a real result for a Chinese model at this price point.
That's now two Chinese models in our top 6, both at sub-$3.5/run. When we started this benchmark in February, neither of these tiers existed outside US labs.
Congrats to the DeepSeek and Xiaomi MiMo teams.
Full write-up: https://foodtruckbench.com/blog/deepseek-v4-pro Leaderboard:
