Deepseek v4 flash로 대규모 코드 변경 테스트를 해봤는데, 툴 사용 정확도가 미쳤네요!
Tested Deepseek v4 flash with some large code change evals. It absolutely kills with too use accuracy!
핵심 요약
Deepseek v4 flash 모델이 복잡한 툴 호출과 긴 컨텍스트 관리에서 뛰어난 정확도를 보여줌.
- 툴 사용 정확도 — 복잡한 다중 툴 호출이나 대규모 코드 변경 작업에서도 오류 없이 완벽하게 수행함.
- 컨텍스트 관리 — 긴 컨텍스트에서도 혼란 없이 대규모 코드베이스를 이해하는 능력이 매우 뛰어남.
- 성능의 단점 — 토큰 생성 속도가 느리고, 계획 및 실행 단계에서 생각하는 시간이 꽤 오래 걸림.
- 향후 전망 — Deepseek 측에서 하반기에 더 많은 컴퓨팅 자원을 투입할 예정이라 기대가 큼.
v4 flash로 몇 가지 테스트 작업을 해봤음. 컨텍스트 관리, 툴 사용 정확도, 그리고 생각하는 과정(thinking traces) 모두 훌륭했음. 내가 테스트해 본 오픈 웨이트 모델 중 다중 툴 호출이나 복잡한 네이티브 툴 정의에서 혼란을 겪지 않는 몇 안 되는 모델임.
여러 번 실행하면서 최소 100번은 툴을 호출했는데, 한 번도 오류가 없었음. 한꺼번에 여러 파일을 수정할 때조차도 말임.
단점: 토큰 생성 속도가 느리고 생각하는 데 시간이 좀 걸림(영상에는 안 나왔지만, 계획하고 실행하는 데 몇 분은 걸렸음).
Deepseek가 26년 하반기에 더 많은 용량을 확보한다는 글을 봤음. 기대됨, 가즈아!



