Codex 시대의 종말. OpenAI에 대한 신뢰가 완전히 깨졌다. 그들은 몰래 모델 성능을 떨어뜨리고 있다.
The End of the Codex Era. I've Completely Lost Trust in OpenAI. They're Secretly Degrading Their Models.
핵심 요약
OpenAI가 유료 모델의 성능을 사용자 몰래 저하시키고 있다는 의혹을 제기하며, 이에 대한 구체적인 테스트 방법과 불만을 토로함.
- 모델 성능 저하 — 사용 중인 모델이 갑자기 멍청해지거나 논리적 오류를 범하는 현상이 빈번함
- 비밀스러운 조치 — 사용자에게 고지 없이 모델 성능을 낮추거나 다른 모델로 우회시키는 것으로 의심됨
- 검증 방법 공유 — 기능 명세 작성, 특정 논리 퀴즈, 자전거 타는 펠리컨 SVG 생성 등을 통해 성능 저하 확인 가능
- 대안 모색 — OpenAI의 불투명한 운영에 실망하여 Cursor나 오픈 소스 모델로 이탈하는 사용자가 늘어남
난 지금까지 줄곧 Codex 광팬이었음. Codex 하나에만 1500억 토큰 넘게 태웠으니까.
이번 주에 Codex 할당량이 아직 남았는데도, 지난 3일 동안은 그냥 Cursor Ultra 구독 써버렸다.
왜냐고?
OpenAI가 모델 성능을 계속 떨어뜨리고 있거든. 내 경험으로도 확실히 느껴지고, 이걸 뒷받침하는 증거도 존나 많음.
Astra, Sol, 심지어 Luna까지 포함해서 자기네 모델 전부 다 성능을 낮추고 있다고.
근데 제일 빡치는 건 이걸 몰래 하고 있다는 거야.
Codex로 멀쩡하게 작업 시작했다가 5분 뒤에 보면, 같은 스레드 안에서 모델이 병신이 되어 있음. 갑자기 Astra가 Luna 수준으로, 아니 그보다 더 구려짐.
근데 할당량은 똑같이 처먹음.
이게 매일 일어나는 일임.
Codex 켜서 간단하게 성능 테스트해보면 다 정상임. 근데 20분 뒤에 같은 스레드에서 똑같은 테스트 돌려보면 모델 성능이 씹창나 있음.
가끔은 VPN만 켜도 모델이 다시 잠깐 정상으로 돌아오기도 함.
모델이 맛탱이 갔는지 확인하는 법
1. 기능 명세서 기획 및 작성
기능 기획하고 명세서 쓴다고 쳐보자.
모델이 멍청해지면 바로 티가 남. 개소리만 늘어놓고, 이 기능을 실제로 어떻게 구현해야 하는지 제품에 대한 이해도가 아예 없어짐.
근데 모델이 뭘 잘못 이해했는지 지적하고 고쳐보라고 하면 더 확실하게 티가 남.
문제의 핵심을 파악하는 대신, 뭐가 잘못됐는지 이해도 못 한 채로 쓸데없는 사과만 존나게 해댐.
축하한다. 너는 지금 맛탱이 간 모델이랑 대화 중이다.
내가 겪은 일임.
정상적인 모델로 기능 명세서를 썼음. 다 제대로 작성됐고, 논의도 됐고, 검토도 끝났지.
그다음 구현은 Luna한테 맡겼고, Sol이 검토해서 승인까지 했음.
근데 막상 구현된 거 보니까 구멍 투성이에, 계획에도 없던 것들이 들어가 있더라.
이 경우는 구현 단계에서 모델이 맛탱이 간 걸로 의심됨.
결국 다 고치느라 시간 두 배로 날림.
이걸 테스트하는 방법이 몇 가지 더 있음.
2. 펠리컨(PELICANS).
이 프롬프트를 써봐:
Create HTML code with SVG graphics displaying a 2D animation of a pelican riding a bicycle. No additional tests are required.



