DeepSeek V4 Flash 0731, 독립적인 공개 하네스 실행(445회 시도)에서 Terminal-Bench 2.1 82.7% 기록
DeepSeek V4 Flash 0731 hits 82.7% on Terminal-Bench 2.1 in an independent public-harness run (445 trials)
핵심 요약
DeepSeek V4 Flash 0731 모델이 독립적인 벤치마크 테스트에서 82.7%의 정확도를 기록하며 성능을 입증했습니다.
- 독립적 검증 — 공개된 하네스를 사용하여 DeepSeek의 벤치마크 결과를 재현함
- 성능 지표 — 445회 시도 중 368회 성공으로 82.7% 정확도 달성
- 테스트 환경 — OpenRouter를 통해 deepseek-v4-flash-0731 모델을 사용하여 측정함
- 데이터 공개 — 모든 설정과 시도 기록을 포함한 Harbor 작업 결과가 공개됨
공지: 저는 Ante의 작성자입니다.
DeepSeek는 최근 DeepSeek V4 Flash 0731에 대해 Terminal-Bench 2.1에서 82.7%의 점수를 기록했다고 보고했습니다. 해당 평가는 아직 공개되지 않은 "DeepSeek Harness minimal mode"를 사용했습니다.
우리는 보고된 결과가 공개되어 다운로드 가능한 하네스를 사용하여 독립적으로 재현될 수 있는지 확인하고자 했습니다.
Ante 0.preview.71을 사용하여 얻은 결과는 다음과 같습니다:
- 445회 시도 중 368회 성공
- 82.7% 정확도 (±1.79 SE)
- 89개의 Terminal-Bench 2.1 작업
- 작업당 5회 시도
- 최대 추론 노력(max reasoning effort)
- 활성화된 기술 없음
- OpenRouter를 통한
deepseek/deepseek-v4-flash-0731
전체 Harbor 작업은 공개되어 있습니다. 여기에는 고정된 설정과 보상, 예외, 지속 시간, 토큰 사용량을 포함한 445개의 모든 시도 기록이 포함되어 있습니다.
Deep seek v4는 하네스에 민감한 것으로 보이며, 이는 관심 있는 분들에게 유용한 데이터가 될 것입니다.
출처:
- DeepSeek의 보고된 결과: https://api-docs.deepseek.com/updates/
- 공개 Harbor 실행 및 설정: https://hub.harborframework.com/jobs/b2a14e4b-a422-45f2-832e-cf2eec5c8bff
- Ante 벤치마크 페이지: https://antigma.ai/eval


