[FrontierHarness] 같은 모델, 같은 성공률. 왜 Claude Code가 DSH보다 5.6배나 비쌀까?
[FrontierHarness] Same model, same pass rate. Why did Claude Code cost 5.6× more than DSH?
핵심 요약
Claude Code와 DSH의 동일한 모델 성능 대비 비용 차이 원인을 분석하고 토론하는 글입니다.
- 비용 격차 분석 — 동일한 성공률에도 Claude Code가 DSH보다 5.6배 높은 비용 발생함
- 캐싱 이슈 — 특정 작업에서 토큰 사용량의 68%가 집중되어 비용 차이의 원인으로 지목됨
- 벤치마크 신뢰도 — 커뮤니티에서는 해당 벤치마크의 공정성과 측정 방식에 의문을 제기함
- 도구 성능 논쟁 — Claude Code의 하네스 품질과 타사 도구와의 비교가 활발히 논의됨
Claude Code랑 DSH Creator 둘 다 19/30개 과제를 통과했는데, 통과당 평균 비용은 Claude Code가 $18.34, DSH Creator가 $3.28로 차이가 꽤 나네. 둘 다 우리 공용 게이트웨이를 통해서 Kimi K3를 썼거든. [source: https://frontierharness.org/\]
캐싱 때문에 차이가 좀 났을 수도 있어. Claude Code가 쓴 전체 토큰의 68%가 과제 하나에서 다 나갔거든. 아직 하니스(harness), 모델, 게이트웨이 중 뭐가 문제인지 확실하게 분리해서 볼 수가 없어서, 이게 순수하게 Claude 성능 비교라고 보긴 어려워.
너라면 이 비용 차이 원인 찾으려고 제일 먼저 뭘 테스트해 볼래?


