후속: 2x RTX PRO 6000에서 구동한 DeepSeek V4 Flash가 Sonnet 및 Opus보다 코딩 작업 속도가 빠름 (품질은 Sonnet 수준)
Follow-up: DeepSeek V4 Flash on 2x RTX PRO 6000 finishes real coding tasks faster than Sonnet and Opus, at about Sonnet quality
핵심 요약
DeepSeek V4 Flash가 로컬 환경에서 Sonnet 수준의 품질로 API 모델보다 빠른 코딩 성능을 보여준다는 벤치마크 결과입니다.
- 벤치마크 결과 — DeepSeek V4 Flash가 Sonnet/Opus보다 빠른 코딩 작업 속도를 기록함
- 품질 비교 — Sonnet 수준의 품질을 유지하며 로컬 환경에서 효율적인 성능을 보임
- 테스트 환경 — vLLM 기반의 로컬 환경에서 실제 코딩 작업 흐름을 측정함
- 데이터 공개 — 상세한 벤치마크 차트와 데이터 시트를 웹사이트에 게시함
이 글은 긴 컨텍스트에서도 로컬 모델들이 얼마나 빠르게 유지되는지에 대한 이전 게시물의 후속 내용이며, 이곳의 많은 분들로부터 많은 것을 배웠습니다. 그 이후로도 계속 측정해 보았고, 이제는 제대로 된 인디 코딩 벤치마크가 되었습니다. vLLM에서 구동되는 DeepSeek V4 Flash는 Sonnet 수준의 품질을 보여주며, API를 거치는 Sonnet이나 Opus보다 실제 작업 완료 시간(wall-clock)이 더 빠릅니다(품질 면에서는 여전히 Opus와 Fable이 우세합니다).
DeepSeek는 작업당 약 2분이 소요되는 반면, Sonnet 3.5는 작업당 약 6분으로 가장 느렸습니다**(대략 DeepSeek보다 3배 정도 느림..!)**. 새로운 Sonnet은 느리긴 하지만 매우 일관적이고 무작위성이 낮으며, 결과를 내기까지 많은 턴이 필요합니다. 또한 많은 분이 익숙하실 Qwen 3.6 모델들도 기준점으로 포함했습니다.
우리가 흔히 모델을 사용하는 방식대로 테스트했습니다. 로컬 모델은 OpenCode에서, Claude 모델은 Claude Code API를 통해 실행했으므로 하네스는 다르지만, 격차의 일부는 순전히 모델만의 문제가 아닙니다. 저는 이 둘을 분리하려고 하지 않았는데, 질문의 핵심은 진공 상태에서 어떤 원본 모델이 이기느냐가 아니라, 사람들이 실제로 사용하는 방식으로 설정했을 때 어떤 결과를 얻느냐였기 때문입니다. Opus와 Fable이 여전히 가장 좋은 diff를 만들어내는 것은 분명하므로, 단 하나의 최고의 답을 원한다면 그쪽을 선택해야 합니다. 하지만 로컬 모델들도 이제는 정말 훌륭합니다... 그리고 dense attention만 피한다면 정말 빠릅니다!
벤치마크를 하면서 완전히 과하게(OTT) 몰입했는데, 즐길 수 있는 많은 차트와 상세한 분석, 그리고 전체 데이터 시트가 있습니다. https://nqawhc.github.io/articles/local-vs-api/ (여기서 여러 페이지를 탐색할 수 있습니다!)
이제 기초적인 작업은 모두 마쳤으니, 앞으로 새로운 모델들이 나올 때마다 다시 테스트할 예정입니다.


