DeepSeek v4는 어떻게 코딩 리더보드 1위를 차지하면서도 최첨단 모델보다 8개월이나 뒤처질 수 있을까?
How can Deepseek v4 top the coding leaderboards and still sit 8 months behind the frontier?
핵심 요약
코딩 성능과 실제 추론/에이전트 능력 간의 괴리에 대한 분석입니다.
- 코딩 리더보드 — 특정 작업에 최적화되어 높은 점수를 기록함
- 성능 격차 — 코딩 외 사이버 보안 및 추론 영역에서 8개월 뒤처짐
- 로컬 실행 — 양자화 및 도구 호출 시 실제 성능 저하 발생
- 벤치마크 신뢰도 — 기업 발표 자료는 마케팅 수단으로 간주해야 함
이 모델에 대해 서로 잘 맞지 않는 두 가지 수치가 있음. Pro 구성은 SWE-bench Verified에서 80.6점, LiveCodeBench에서 93.5점을 기록하며 모든 리더보드 상단에 코딩 점수를 올리고 있음. 그런데 CAISI가 다양한 도메인에 걸쳐 테스트한 결과, 미국 최첨단 모델보다 약 8개월 뒤처진 GPT-5 수준 정도로 평가됨. 출시 당시 DeepSeek 자체 프레임워크는 2개월 뒤처진, 당시 최첨단 모델 바로 뒤라고 했음. 같은 가중치인데 판결은 매우 다름.
내가 읽기로는 둘 다 맞고 서로 다른 것을 측정하고 있는 것임. 코딩 리더보드는 좁은 영역이고 모두가 가장 열심히 최적화하는 영역이라, 거기서 높은 점수를 받는다는 건 코딩을 잘한다는 뜻이지 추론이나 에이전트 측면에 대해서는 별 의미가 없음. CAISI는 부하를 더 넓게 분산시켰고 사이버 보안과 추론 영역에서 격차가 드러났음.
그리고 최첨단 모델들도 가만히 있지 않음. 이번 주에 Fable 5가 나왔는데, 이건 자기 컴퓨터에서 돌릴 수 없는 폐쇄형 모델임. 이 모든 것 위에 로컬이라는 관점이 있음. 모두가 인용하는 수치는 1.6T Pro 구성인데, 이건 우리 대부분이 돌리는 게 아님. Flash나 자기 컴퓨터에 맞는 양자화 버전을 돌릴 때쯤이면 헤드라인과는 또 한 단계 멀어지게 됨.
에이전트 작업을 위해 로컬에서 돌리는 사람들에게, 양자화되고 코드 완성이 아닌 도구 호출을 수행할 때 실제 성능은 어느 정도인가?


