DeepSeek V4 Pro를 Pi와 DeepSeek 자체 Harness에서 돌려봤는데, Pi가 여전히 압승이네요.
I ran DeepSeek V4 Pro through Pi and DeepSeek’s own Harness. Pi still cooked.
핵심 요약
DeepSeek V4 Pro를 Pi와 자체 Harness로 비교 테스트한 결과, 성능은 비슷하나 Pi가 더 안정적인 결과를 보였습니다.
- 성능 비교 — Pi와 DeepSeek Harness 간의 에이전트 도구 사용 작업 효율을 벤치마킹함
- 결과 분석 — 작업 성공률은 비슷하지만 Pi가 1개 더 성공했고, Harness는 속도와 비용 면에서 우세함
- 아키텍처 차이 — Harness는 복잡한 기능을 다수 포함하며, Pi는 단순한 철학을 유지함
- 효율성 논란 — 토큰 사용량과 비용 차이는 엔드포인트 환경 차이로 인해 미미한 수준임
DeepSeek은 자기네 모델 전용으로 하네스를 아예 새로 짰길래, V4 Pro가 Pi 안에서 돌아갈 때보다 거기서 더 잘 돌아갈지 궁금하더라고.
똑같은 모델로 어려운 에이전트 툴 사용 과제 30개를 900초 제한 걸고 돌려봤음:
| Metric | Pi | DeepSeek Harness |
|---|---|---|
| Passed | 21/30 | 20/30 |
| Median time | 362.9s | 252.1s |
| Cost/shared success | $0.031 | $0.028 |
결과는 30개 과제 중 27개가 똑같이 나와서 사실상 무승부였음. Pi가 과제 하나를 더 끝내긴 했는데, DSH가 눈에 띄게 빠르고 비용도 살짝 더 저렴했음.
점수보다 아키텍처 차이가 더 흥미로운 부분임.
DSH에는 Pi가 일부러 뺀 기능들이 엄청나게 많음. 다 말하기엔 너무 많지만, 몇 개만 꼽자면 플러그인 그래프, 교체 가능한 에이전트 루프, 샌드박싱, 서브 에이전트, 리플레이, append-only 트래젝토리 같은 것들임.
근데 웃긴 건 뭔지 앎? DeepSeek의 Minimal 모드는 쉘 + 에디터 + 아주 짧은 프롬프트 정도로 기능을 싹 쳐내는데, 이게 Pi가 추구하는 철학이랑 놀라울 정도로 비슷함. 심지어 DSH는 DeepSeek 모델이 아닐 때는 Pi의 pi-ai 모델 레이어를 갖다 씀 (이거 최근에 알았음).
한 가지 주의할 점은, DSH는 과제당 런타임 토큰을 8만 8천 개 정도 썼는데 Pi는 92만 5천 개를 썼거든. 근데 이걸 단순히 10배 효율이 좋다고 보긴 좀 그럼. DSH는 DeepSeek 네이티브 엔드포인트를 썼고 Pi는 OpenRouter를 거쳤으니까 캐싱이나 토큰 계산 방식이 완전히 같지는 않음. 실제 비용 차이도 거의 없었고.
둘 다 써본 사람들은 어떻게 생각하는지 궁금하네.


