Claude Code, Codex, OpenCode, Pi를 14일간 동일 모델로 테스트함. 같은 품질인데 비용이 7배 차이남
I ran the same model through Claude Code, Codex, OpenCode, and Pi for 14 days. The harness changed cost 7x at the same quality
핵심 요약
AI 에이전트의 래퍼(harness)에 따라 동일 모델 성능과 비용이 크게 달라짐을 입증한 실험 결과입니다.
- 실험 설계 — 동일한 모델과 도구를 사용하여 4가지 에이전트 래퍼의 성능과 비용을 14일간 비교함
- 비용 효율성 — Pi가 가장 적은 토큰 사용량으로 높은 성공률을 기록하며 비용 효율성에서 압도함
- 프롬프트 오버헤드 — Claude Code는 시작부터 방대한 시스템 프롬프트를 사용하여 컨텍스트를 낭비함
- 보안 고려사항 — Codex는 커널 수준 샌드박스를 제공하지만 Pi는 보안 가이드라인이 부족함
Claude Code, Codex, OpenCode, Pi 이 넷을 계속 갈아타면서 써봤는데, 아무도 '하니스(harness)' 자체를 변수로 두고 제대로 비교하는 놈이 없다는 걸 깨달았다. 그래서 내가 직접 해봤다.
이 네 가지를 전부 설치해놓고 번갈아 써보다가, 문득 다들 모델 벤치마크만 하지 정작 에이전트(나는 이걸 래퍼라고 부름) 자체를 테스트하는 놈은 없다는 게 눈에 들어오더라.
똑같은 레포지토리에서 14일 동안 실무를 돌리고, 모든 하니스에 똑같은 모델(DeepSeek V4 Flash)이랑 MCP 라우터를 거친 동일한 툴을 박아 넣어서 에이전트 작업 30개를 수행했다. 작업당 제한 시간은 900초. 오직 하니스만 바꿨다.
| Harness | Passed | Median time | Avg tokens/task | Cost per success |
|---|---|---|---|---|
| Pi | 20/30 | 132.2s | 558,885 | $0.028 |
| Claude Code | 16/30 | 122.7s | 741,659 | $0.195 |
| Codex | 16/30 | 245.0s | 664,772 | $0.081 |
| OpenCode | 14/30 | 129.7s | 692,195 | $0.073 |
여기서 진짜 머리 깨질 뻔한 게 뭐냐면, Pi는 툴을 딱 4개(read, write, edit, bash)만 쓰고 시스템 프롬프트도 1K 토큰 미만인데, 이게 이겨버림. 반면에 Claude Code는 첫 채팅 시작하기도 전에 프롬프트랑 툴 스키마로만 33K 토큰을 컨텍스트에 처박더라.
나만 그런 것도 아님. Databricks에서 수백만 줄짜리 코드베이스에 Opus 4.8을 둘 다 돌려봤는데, Claude Code는 작업당 742K 토큰을 먹는 반면 Pi는 237K 토큰으로 똑같은 성공률을 뽑아냄. 모델은 같은데 래퍼 하나 바꿨다고 비용이 반토막 난 거임.
2주 동안 쓰면서 느낀 잡다한 점들. Codex는 유일하게 커널 레벨 샌드박스(맥은 Seatbelt, 리눅스는 bubblewrap + seccomp, 네트워크는 기본 차단)를 갖춘 놈이라, 좀 찜찜한 클론 레포지토리 돌릴 땐 이것만 쓴다. 대신 속도는 더럽게 느림. 다른 놈들보다 중간값이 두 배는 더 걸려. Pi는 가드레일이 아예 없어서 첫 메시지부터 시스템 전체 접근 권한을 다 털어가니까, 도커를 쓰든가 아니면 기도 메타로 가야 함.
작업 리스트랑 결과 보고서도 다 있으니까 보고 싶은 사람 있으면 댓글에 남겨둘게.

