Pi와 그 포크 버전인 OMP를 벤치마크해 봤습니다. 도구가 많다고 꼭 좋은 건 아니더군요.
I benchmarked Pi against its own fork, OMP. More tooling did not win.
핵심 요약
최소한의 도구만 사용하는 Pi가 기능이 방대한 OMP보다 벤치마크 성능과 비용 효율성 면에서 더 우수한 결과를 보였습니다.
- 성능 비교 — Pi가 OMP보다 더 높은 성공률과 빠른 처리 속도를 기록함
- 비용 효율성 — OMP는 Pi 대비 토큰 사용량이 많아 성공당 비용이 훨씬 높음
- 도구의 과잉 — 과도한 기능과 도구가 오히려 모델의 효율성을 저해할 수 있음
- 사용자 경험 — 단순한 도구 구성이 복잡한 환경보다 실무에서 더 효과적일 수 있음
Pi의 미니멀한 에이전트 루프에 Pi가 의도적으로 빼버린 기능들을 죄다 때려 박으면 어떻게 될지 궁금해서 한번 해봤다.
OMP는 Pi를 포크한 거긴 한데, 하네스는 완전히 딴판임.
Pi는 주로 read, write, edit, bash 정도만 쓰거든.
근데 OMP는 31개가 넘는 도구에, hashline 편집, LSP, DAP 디버깅, Python/Bun 커널, 브라우저, 그리고 grep/glob/bash/파싱을 위한 Rust 코어까지 다 때려 박았음.
그래서 똑같은 30개의 빡센 에이전트 작업으로 둘 다 돌려봤다. DeepSeek V4 Flash 모델을 썼고, 외부 도구랑 검증기(verifier)도 똑같이 맞췄으며, 시간 제한은 900초로 걸었음.
| Metrics | Pi | OMP |
|---|---|---|
| Passed | 20/30 | 17/30 |
| Median time | 132s | 272s |
| Tokens/task | 559k | 742k |
| Cost/success | $0.028 | $0.103 |
최종 점수보다 작업별로 갈린 게 더 흥미롭더라. 둘 다 똑같이 16개 작업은 통과했고, 똑같이 9개 고난도 작업은 말아먹었음. 20 대 17이라는 점수 차이는 딱 5개 작업에서 갈린 거임. 그중 4개는 Pi가 이겼고, OMP는 1개 이겼다.
OMP는 정답 데이터는 잘 찾아놓고도 시간이나 컨텍스트가 다 떨어질 때까지 질질 끄는 경우가 많았음. 실패한 작업 중 하나는 1.22M 토큰이랑 861초를 썼는데도, 결과 페이지를 더 봐야 한다고 징징대다가 멈추더라. 비용 청구 작업에서는 1.8M 토큰을 썼는데도 검증기 체크는 3/13밖에 통과 못 함.
물론 OMP 하네스에 괜찮은 아이디어도 있긴 함. 16개 모델을 대상으로 한 별도의 편집 벤치마크에서 hashline을 쓰니까 성공률이 평균 15% 포인트 정도 올랐거든. Grok Code Fast 1 모델은 **6.7%에서 68.3%**까지 떡상함.
근데 이번 테스트에서는 OMP가 Pi보다 작업당 토큰을 33% 더 많이 썼고, 중앙값 기준으로 시간도 2배 넘게 걸림.
그래도 OMP가 우리가 테스트한 8개 하네스 중에서 2등은 찍었다. Claude Code, Codex, OpenCode, Hermes, DeepAgents보다는 위임.
그래서...
도대체 어느 정도 수준의 하네스가 '과유불급'인 걸까?


