같은 작업, 같은 모델: Pi는 90턴, Codex는 187턴. 추가 턴은 무엇을 위한 것이었나?
Same task, same model: Pi passed in 90 turns. Codex needed 187. What were the extra turns buying?
핵심 요약
Pi와 Codex의 작업 효율성을 비교하며, 턴 수가 적다고 반드시 더 효율적인 것은 아닐 수 있다는 점을 논의합니다.
- 성능 비교 — Pi가 Codex보다 적은 턴 수와 비용으로 동일 작업을 완료함
- 측정 지표 — 턴 수가 작업의 유용성을 판단하는 절대적 기준이 될 수 없음
- 시스템 프롬프트 — 프롬프트 컨텍스트 최적화가 효율성에 큰 영향을 미침
- 데이터 해석 — 성공한 작업만 집계되므로 단순 턴 수 비교는 왜곡될 수 있음
python-statemachine 작업 하나를 놓고 봤을 때, Pi는 90턴 만에 $2.50으로 통과했어. 반면 Codex는 187턴이나 걸려서 $5.97이 나왔지. 둘 다 똑같은 평가 환경에서 Kimi K3를 썼는데 말이야. [출처: https://frontierharness.org/]
전체 30개 작업으로 넓혀보면, Pi는 18개를 통과했고 통과당 중간 비용은 $2.43이었어. 단일 작업 비교만으로는 Pi가 왜 턴 수를 적게 썼는지, 아니면 다른 작업에서도 이런 패턴이 유지되는지는 알 수 없지.
우리 추천은 이거야: 똑같은 작업을 수천 번씩 돌려서 비용이 눈덩이처럼 불어나는 상황이라면, 밸런스 잡힌 Pi를 쓰는 게 정답이지.
트레이스에서 뭘 확인해봐야 할까? 반복적인 검색, 불필요한 테스트, 아니면 잘못된 접근 방식을 수정하느라 허비한 시간 같은 것들 아닐까?


