4가지 AI 코딩 도구(Codex, Pi, Claude Code, OpenCode) 성능 비교 테스트
I tested 4 AI coding harnesses (Codex, Pi, Claude Code, OpenCode) with the same models.
핵심 요약
다양한 AI 코딩 도구의 성능을 비교한 결과, Pi가 일관된 속도와 효율적인 토큰 사용량으로 가장 우수한 성능을 보였습니다.
- 성능 비교 — Pi, Codex, Claude Code, OpenCode의 코딩 작업 효율성 측정
- Pi의 우위 — 일관된 작업 속도와 타 도구 대비 40% 적은 토큰 사용량 기록
- 프록시 주의 — 모델 설정 오류로 인한 의도치 않은 모델 전환 가능성 확인
- 도구 선정 — OpenCode의 낮은 효율성으로 인해 Pi와 Codex를 주력으로 채택
너희들처럼 나도 AI 코딩 툴을 이것저것 다 깔아놓고 써보는 중이야(Codex, Pi, Claude Code, OpenCode 등등). 내 환경이랑 매일 하는 작업에 제일 잘 맞는 놈을 찾으려는 게 목적이지.
세팅
대상 레포: oh-my-opencode-slim. 별다른 이유는 없고 그냥 켜져 있길래 골랐어.
환경: Macos, 각 테스트는 독립된 Git worktree에서 깔끔하게 진행함.
1단계: GPT-5.6 Luna
예를 들어, GPT-5.6 Luna medium 모델을 4개 툴에 돌려서 코딩 버그 수정 작업을 시켜봤어(alias 카운터 메모리 누수 수정 + 테스트 코드 작성):
| Harness | Wall Time | Fresh Input | Total Input | Cache Hit % | Correctness | Status |
|---|---|---|---|---|---|---|
| Codex | 107.73s | 50.3k | 505.4k | 90.1% | 3/3 | Verified |
| Pi | 140.96s | 44.2k | 525.4k | 90.9% | 3/3 | Verified |
| OpenCode stable | 274.43s | 109.4k | 1797.1k | 93.9% | 3/3 | Verified |
| OpenCode beta | 402.75s | 79.8k* | 1015.4k* | 91.4%* | 3/3 |
OpenCode stable이 똑같은 수정 작업인데도 시간은 2.5배 더 걸리고 컨텍스트 토큰은 3.5배나 더 처먹는 거 보고 바로 테스트에서 제외함.
2단계: Muse 1.2 contributor로 전환
다음 단계로는 좀 더 싸고 접근하기 쉬운 비 GPT 모델을 테스트해보고 싶었어. 마침 CommandCode 구독 중이라 Muse Spark 1.2 Contributor를 골랐고, OpenCode stable 대신 Claude Code(OpenCodex 프록시 경유)에서 돌려보기로 했지.
근데 여기서 실수함. OpenCodex에서 Claude Code용 모델 별칭 설정을 까먹은 거야.
그 바람에 Pi, Codex, OpenCode beta는 Muse Spark 1.2로 잘 돌아가는데, Claude Code만 4개 작업 내내 Sonnet 5(xhigh thinking)로 멋대로 돌아가 버림:
| Task | Pi (Muse 1.2) | Codex () |
|---|


