3월 26일부터 2만 번 넘는 세션에서 6,500억 토큰을 태웠는데, 진짜로 Codex는 날이 갈수록 성능이 떨어지고 있음.
I’ve burned through 650 billion tokens across more than 20k recorded sessions since 03/26 - and yes: Codex is getting worse each day.
핵심 요약
대규모 토큰 사용자가 OpenAI Codex(Astra)의 성능 저하와 모델의 지능 저하 현상을 비판함.
- 성능 저하 — 모델이 과거보다 일관성을 잃고 초보적인 실수를 반복함.
- 사용자 경험 — 작업 속도가 느려지고 결과물이 깔끔하지 않아 답답함을 느낌.
- 모델 신뢰도 — 버전 관리나 API 호출 등에서 모델의 판단력이 크게 떨어짐.
- 대안 모색 — 일부 사용자는 서브 에이전트 사용을 제한하거나 다른 모델을 권장함.
3월 26일부터 2만 번 넘는 세션 돌리면서 토큰 6,500억 개를 태워 먹었어. 우리 팀이 쓴 건 빼고 순수하게 내가 쓴 것만 이 정도야.
텔레메트리, 로그, 감사 추적 데이터까지 싹 다 가지고 있어(아마 수백 GB는 될걸). 700만 줄이 넘는 프로덕션 코드베이스에서 모델들이 한 짓거리를 전부 기록해 뒀거든. 더 궁금한 거 있으면 DM 줘.
근데 요즘 Codex(Astra) 성능 때문에 진짜 열받아 미치겠어. max/ultra 모델을 써도 이 모양이야.
2007년부터 코딩했고, GPT-3.5가 어느 정도 코딩 가능하다는 거 깨달은 이후로는 LLM을 계속 써왔어.
그동안 Agentic Engineering이나 하네스(harnesses) 같은 것들에 대해 진짜 많이 배웠지. 이런 통찰력으로 돈도 꽤 벌고, 사업도 빠르게 키워서 대기업들이랑도 일하고 있어.
그러니까 사실 불평하면 안 되는 처지긴 해. 일은 대체로 잘 풀리고 있으니까.
그래도 솔직하게 말할게.
Codex 하네스에서 돌아가는 Astra는 진짜 별로야. 맨날 "거버넌스 쇼"나 해대고, 목표는 자꾸 까먹고, 신입 수준의 실수나 저지르고 있어. 풍차 하나 만들면 될 걸 굳이 핵발전소를 짓고 앉았다고.
요즘 모델들은 버전, 계약, API, 가정 같은 것들을 일관성 있게 유지하는 능력이 너무 떨어져. 예전엔 훨씬 나았는데 말이야.
전반적으로 지금 Codex랑 일하는 건 전혀 날카롭지가 않아. 마치 꿀 속을 헤엄치는 기분이야. 끈적거리고, 느려 터지고, 뭘 시작해도 끝맺음이 영 시원찮아.
OpenAI가 제발 모델들 뇌를 그만 좀 파먹었으면 좋겠어. 지금 나도 점점 짜증 나고, 우리 팀도 다들 지쳐가고, 코딩하는 재미도 하루가 다르게 사라지고 있거든.
앞으로 얼마나 더 내 고객들한테 Codex를 추천할 수 있을지 모르겠어. 솔직히 이젠 이게 고객들 도와주는 건지조차 확신이 안 서거든.
고맙다.


