6개 하니스 x 11개 모델 x 226개 작업에 대한 벤치마크를 수행했습니다
I benched 6 harnesses x 11 models x 226 tasks
핵심 요약
텍스트 편집 성능을 측정하는 벤치마크를 구축하고, 하니스와 모델 조합이 성능에 미치는 영향을 분석했습니다.
- 벤치마크 구축 — 텍스트 편집 작업에서 모델과 하니스 조합의 성능을 측정함
- 하니스 중요성 — 동일 모델이라도 하니스에 따라 성능 차이가 크게 나타남
- DeepSeek 성능 — DeepSeek 모델과 전용 하니스가 매우 우수한 성능을 보임
- 데이터 기여 요청 — 리소스 부족으로 추가적인 벤치마크 데이터 수집을 희망함
안녕! 내가 https://github.com/alexshpunt/explicit-edit-benchmark를 만들어서 계속 관리 중인데, 이 프로젝트는 "어떤 모델이 더 나은지, 어떤 하네스가 더 나은지, 그리고 어떤 조합이 전반적으로 가장 뛰어난지"를 아주 직관적인 작업인 '정밀 텍스트 편집'을 통해 확인해보려는 거야. 사실 코딩 업무의 대부분이 텍스트 편집이잖아. 모델이 여러 번 시도해도 자기가 바꾸고 싶은 줄을 어떻게 표현해야 할지 몰라서 헤매는 걸 보고 "아니, 그냥 텍스트인데 왜 이렇게 복잡하게 굴지?"라는 생각이 들더라고. 근데 같은 모델이라도 하네스에 따라 동작이 완전히 달라지는 걸 보면, 그게 꼭 그렇지만도 않은 것 같아. 내 잠정적인 결론은 이거야. 하네스랑 그 뒤에 붙는 툴링이 진짜 중요하다는 거! 근데 이게 지시 사항을 제대로 따를 수 있는 모델(예: OpenAI 모델)에서 특히 더 크게 작용해. gpt-5.6-luna만 봐도 하네스 하나 바꿨다고 패스 점수가 **98.9%**에서 **70.2%**까지 널뛰기를 하거든.
가능한 한 많은 조합을 돌려보려고 했는데, 내 자원이 한정적이라 한계가 있네. 할당량도 다 쓰고 크레딧까지 바닥나서 커뮤니티에 도움을 요청해. 꽤 흥미로운 주제라고 생각하고, 데이터가 더 많이 모이면 좋겠거든. 이게 확률적인 요소가 강해서 충분한 횟수의 테스트가 쌓여야 제대로 된 결론을 낼 수 있거든.
진짜 놀라운 건 deepseek 모델 계열이 어떤 하네스에서든 일관되게 강력한 성능을 보여준다는 점이야. 그리고 deepseek 하네스 자체가 얼마나 잘 만들어졌는지도 흥미롭고. 꽤 탄탄하고, 모델이 이 경쟁에서 우위를 점할 수 있도록 충분히 좋은 도구들을 제공하는 것 같아.
데이터셋 뷰어: https://huggingface.co/spaces/alexshpunt/benchmark-explorer
데이터셋 링크: https://huggingface.co/datasets/alexshpunt/explicit-edit-benchmark


