하네스 대결: Claude Code vs OpenCode vs Pi (DeepSeek V4 Flash 사용)
Harness showdown: Claude Code vs OpenCode vs Pi with DeepSeek V4 Flash
핵심 요약
Claude Code, OpenCode, Pi의 성능을 비교한 결과, 코드 품질은 동일하나 하네스에 따라 속도와 토큰 효율성에서 큰 차이가 발생함.
- 하네스 성능 비교 — 동일한 모델을 사용해도 하네스에 따라 도구 호출 방식과 속도가 크게 달라짐
- 품질의 일관성 — 어떤 하네스를 사용하든 최종 코드 결과물은 동일하게 도출됨
- 효율성 차이 — Claude Code는 코드 탐색에 과도하게 시간을 소비하여 가장 느린 결과를 보임
- 도구 활용 방식 — Pi는 추론 위주, OpenCode는 위임 위주로 작동하는 등 하네스별 전략이 상이함
DeepSeek V4 Flash를 Claude Code, OpenCode, Pi에 적용해 내 벤치마크로 돌려봤는데, 품질은 셋 다 거의 똑같았지만 시간과 토큰 소모량은 엄청나게 달랐음. Claude Code(CLIProxyAPI의 DS 사용)는 가장 빠른 것보다 같은 diff를 적용하는 데 4배 가까이 더 오래 걸림.

GPT-5.6 is better in Claude Code
어쨌든 내 작업 부하(대규모 코드 베이스에서의 항원 작업)에서 이 모든 걸 측정해봤음. 전체 차트, 세 하네스 간의 토큰 및 벽시계 시간 분포, 실행별 원시 데이터는 사이트에서 확인할 수 있으니 자세히 보고 직접 분석해보고 싶으면 여기로 가보셈 https://nqawhc.github.io/articles/harness-efficiency-not-quality/ 요약하자면, 품질은 변하지 않았음. 각 하네스는 동일한 코드 diff를 만들어냈지만, 거기에 도달하는 경로는 완전히 달랐음. 도구 호출 횟수, 도구 호출의 구조, 그리고 시스템 프롬프트와 도구가 어떻게 작동하는지가 큰 역할을 함. 예를 들어 «Pi는 추론하고, OpenCode는 위임하는» 식인데, Claude Code는 코드 베이스를 탐색하는 걸 너무 좋아함, 어쩌면 지나칠 정도로.


