우리가 지금 다들 Codex를 '싫어하는' 이유를 알아낸 것 같음.
I think I actually figured why we're all "hating" codex right now.
핵심 요약
Codex의 토큰 소모량이 급증한 원인을 분석한 결과, 모델이 더 많은 단계를 수행하며 컨텍스트를 반복적으로 재전송하기 때문으로 밝혀짐.
- 토큰 소모 분석 — GPT-5.6은 이전 모델보다 더 많은 단계를 수행하여 작업당 토큰 소모량이 2~3배 증가함.
- 컨텍스트 재전송 — 작업당 새로운 입력은 일정하지만, 캐시된 컨텍스트를 여러 호출에 걸쳐 반복적으로 전송함.
- 사용자 경험 격차 — 일부 사용자는 토큰이 순식간에 소진된다고 호소하는 반면, 다른 사용자들은 거의 소모되지 않는 등 경험이 극명하게 갈림.
- A/B 테스트 의혹 — 사용자마다 토큰 소모 프로필이 다르게 적용되는 숨겨진 A/B 테스트가 진행 중일 가능성이 제기됨.
내 계정 토큰 사용량에 대해 https://www.reddit.com/r/codex/comments/1v6ubah/comment/ozt9jog 에서 좀 깊게 파봤다.
이 결과는 codex 세션 로그 약 7.6GB를 분석해서 뽑아낸 거임.
codex가 내가 가진(혹은 가졌던) 모든 구독을 살펴보고 찾아낸 결과는 이거다:
- Plus 1x: 주당 약 105달러
- Pro 5x: 주당 약 525~550달러
- Pro 20x: 주당 약 2,100달러
그리고 몇 달 전이랑 비교했을 때, 요금제마다 토큰 사용량이 25% 정도 줄어든 걸 확인했음.
좋아, 이걸로는 우리가 느끼는 '사용 제한이 예전보다 3~5배는 줄어든 것 같다'는 느낌을 부분적으로밖에 설명 못 함. 그래서 codex한테 내 로그를 더 깊게 파보라고 시켰다. 특히 모델 동작 방식 위주로. 결론은 이거임: 이미지 봐라.
>!그래. 관찰된 사용 패턴에서 확실한 변화를 감지할 만큼 데이터는 충분해. 다만 이걸 전적으로 모델 탓으로만 돌릴 수는 없지.
나는 '작업(task)'을 사용자 요청 하나부터 다음 요청까지의 운영 턴으로 정의했음. GPT-5.4 Mini는 제외했다.
호출당 토큰 사용량
| Model | Calls | Median tokens | New input | Output | Reasoning* | Cache |
|---|---|---|---|---|---|---|
| GPT-5.3 Codex | 8,794 | 86.0K | 1.3K | 222 | 59 | 94.5% |
| GPT-5.4 | 38,845 | 114.3K | 1.4K | 289 | 38 | 94.3% |
| GPT-5.5 | 78,115 | 138.5K | 1.7K | 254 | 20 | 95.4% |
| GPT-5.6 Sol | 111,474 | 129.6K | 1.8K | 183 | 23 | 96.7% |


