GPT-6 Astra burns quota 4+ times faster than GPT-5.6 Sol
핵심 요약
GPT-6 Astra 도입 후 API 가격 인상과 캐시 정책 변경으로 인해 실질적인 사용 가능량이 4분의 1 수준으로 급감했다는 분석입니다.
할당량 급감 — GPT-6 Astra 도입 후 주간 API 상당액이 2,500달러에서 1,200달러로 감소함
캐시 효율 저하 — 캐시 유지 시간이 24시간에서 30분으로 줄어들어 재작업 비용이 크게 증가함
불투명한 정책 — API 가격 인상 외에 추가적인 할당량 삭감이 명확한 설명 없이 진행됨
비효율적 클라이언트 — Codex 앱의 캐시 처리 방식이 비효율적이라 불필요한 토큰 소모가 발생함
그래서 내 Pro 20x 계정 두 개로 각각 따로 테스트해 봤다. 컴퓨터도 다르고, 둘 다 Codex Desktop이랑 CLI만 썼고 컨텍스트 제한이나 설정도 기본값 그대로 뒀음.
세 줄 요약
사용량 대폭 감소: 내 Pro 20x 계정 두 개 다 주간 API 환산 한도가 GPT-5.6 Sol 쓸 때 2,500달러 넘던 게 GPT-6 Astra로 바뀌고 1,200달러 수준으로 떡락함.
이미 오른 가격 반영됨: 저 달러 수치는 이미 Astra의 비싼 API 가격을 적용한 거임. 근데 거기서 한도까지 추가로 깎인 거다.
사용량 거의 4분의 1 토막: 가격은 올랐는데 한도는 줄어드니까, 같은 구독료 내고 쓸 수 있는 양이 사실상 4분의 1 수준으로 줄어듦.
캐시 읽기(이전 작업)에 한도 낭비 심함: 캐시 유지 설정이 엄청 짧아짐. Codex의 Sol은 24시간이었는데 Astra는 30분밖에 안 됨. Codex 캐시 오류까지 겹치니까 긴 대화 내역을 다시 처리해야 하는 상황이 빈번함. 에이전트처럼 길게 작업할 땐 이 내역 재사용하는 게 비용의 대부분을 차지하는데 말이지.
GPT-5.6 Sol 출시 가격이랑 비교하면 GPT-6 Astra는 입력이랑 캐시 입력 비용이 2배, 출력 비용은 1.67배 정도 비쌈. API 가격 정책이나 Codex 요금표를 봐도 이렇게 한도를 추가로 깎은 이유는 안 나옴. 구독 페이지에는 메시지 절반으로 줄어든다고 적혀 있는데, 내가 직접 써보니까 거의 4분의 1 수준임.
이건 Anthropic이 Claude Fable 5 주간 사용량을 50%로 제한했을 때보다 더 심함. 거긴 적어도 나머지 절반으로 Claude Opus 5 같은 다른 모델이라도 돌릴 수 있었거든.
OpenAI한테 기대한 건 이런 게 아니었는데. OpenAI는 자기네 미션이 AI가 모든 인류에게 혜택을 주는 것이라고 떠들고 다님. 비영리 단체가 사업을 통제하는 구조라 미션을 지킬 수 있다고도 하고. 전 세계 대다수 사람들이 이런 구독 서비스를 통해 AI를 접함. 근데 이런 식으로 뒤통수를 치면, 앞으로 더 강력해질 AI를 공익을 위해 쓸 거라고 누가 믿겠냐?
출처: SemiAnalysis. 6월 테스트에서 장기 작업 돌리다가 주간 한도 다 털림. ChatGPT Pro 20x랑 Claude Max 20x를 측정하고 나머지 티어는 추론한 거임. Claude Max 5x 수치는 2,000달러가 아니라 4,000달러가 맞음.
내 테스트 결과(API 환산 달러 기준):
Weekly allowance
Using GPT-5.6 Sol
Using only GPT-6 Astra
Per percentage point
$25+
About $12
Full allowance
$2,500+
About $1,200
GPT-6 Astra의 더 비싼 API 가격은 이미 이 수치들에 다 포함된 거야. 이건 같은 비교를 다르게 표현한 두 가지 방식일 뿐임. 남은 할당량이 0%가 됐을 때 Astra 총액을 다시 계산해 봤거든. 위에 언급한 여러 도구들인 GPT-6 Astra, Claude Fable, 그리고 직접 계산한 것들을 써서 교차 검증도 마쳤어.
Sac의 분석 방식도 따라 해봤는데, Codex 분석 페이지의 DevTools에서 daily-workspace-usage-counts 응답을 읽어오는 방식이야. 내가 처음에 확인했던 주간 사용량은 54,000 크레딧 정도였는데, Astra로는 28,500 크레딧밖에 안 나오더라고. 크레딧 구매 단가인 달러당 25 크레딧으로 계산하면 2,160달러 대 1,140달러인 셈이지. 후자는 내가 토큰 기반으로 대충 계산했던 1,200달러랑 거의 비슷해.
다른 사용자들의 보고
Pro 20x 구독자의 달러 비교: GPT-5.6 Sol 쓸 때는 1% 포인트당 22~24달러였는데, GPT-6 Astra는 15달러 정도임. 이 비교에도 더 비싼 API 가격이 이미 포함되어 있어.
2,500달러 상당의 API 할당량을 준다고 해서 OpenAI가 그만큼의 비용을 실제로 지출하는 건 아님. 긴 에이전트 작업에서는 대부분의 유료 사용량이 캐시에서 읽어온 반복된 기록들이거든. 이미 처리된 작업을 재사용하는 거지. 이걸 보조금이라고 부른다고 해서 적자라는 뜻은 아니야.
토큰 사용량의 대부분을 차지하는 대기업들은 API 정가를 내지 않아. 훨씬 적게 내지(아마 20% 이하일걸). Codex 사용자들도 40% 할인된 가격으로 크레딧을 살 수 있는 판국인데.
Anthropic 추정치를 보면 소비자 구독은 매출의 아주 작은 부분이야. OpenAI도 비슷할 거라고 봐.
모델 전체 크기가 두 배가 된다고 해서 서비스 비용이 두 배가 되는 건 아님. 큰 배치(batch)는 가중치 비용을 나눠 쓰거든. 반면에 활성 파라미터와 요청당 KV 캐시가 훨씬 더 중요해. 이 수치들이 비슷하다면, 가격을 올리고 할당량을 깎을 만큼 이전 모델에서 바뀐 게 별로 없다는 소리야.
하드웨어와 소프트웨어 효율성은 더 새로운 칩, 추론적 디코딩(speculative decoding), 더 나은 어텐션 커널과 배치 처리 덕분에 서비스 비용을 엄청나게 줄이고 있어. 우리가 받는 할당량은 줄어드는데 이런 효율성 이득은 계속 쌓이고 있다고.
왜 이런 일이 벌어지는 걸까?
악의적인 의도가 있다고 단정 짓고 싶진 않아. 하지만 OpenAI가 IPO를 준비 중인 상황에서, 마진을 개선하라는 압박이 이런 결과로 이어진 건 아닌지 의심이 드는 건 어쩔 수 없네.
소비자 구독은 매출에서 차지하는 비중이 작아 보이는데, OpenAI가 우리를 서서히 쫓아내려는 느낌이 들어. 구독으로 얻는 혜택이 왜 줄어드는지 설명도 없으니 이런 의심을 안 하기가 힘들지. 왜 이런 일이 일어났는지에 대한 내 추측보다, OpenAI가 앞으로 어떻게 대응할지가 훨씬 중요해.
Codex 앱과 CLI 이슈가 사용량 문제를 더 악화시킴
Codex 앱과 CLI에는 이 사용량 문제를 더 키우는 다른 문제들도 있어. 사이드 질문, 새로운 포크, 혹은 서브 에이전트가 전체 대화 내용을 상속받으면서도 정작 캐시는 재사용하지 못하는 경우가 있거든. 결국 우리는 똑같은 기록을 처리하는 데 비용을 또 내고 있는 셈이야.
이건 9월 초에 내가 직접 확인한 결과들이야. "Cached"는 첫 번째 요청이 대화 기록을 재사용했다는 뜻이고, 단순히 도구 지침 같은 작은 블록만 공유한 게 아니야.
Codex baseline
Cache miss?
Continue the current task
No
Resume the same task, with the same surface and settings
Claude Code를 보면 이런 작업 대부분이 접두사를 유지하고 캐시를 재사용한다는 걸 알 수 있어. Codex가 같은 기능을 수행하려고 똑같은 기록을 다시 처리해야 할 이유가 전혀 없지.
Sol은 Codex에 24시간 캐시 유지 설정을 사용했는데, 공개된 응답 로그를 보면 알 수 있어. Astra의 경우, OpenAI는 마지막 쓰기나 재사용 이후 고작 30분이라는 TTL 설정을 문서화해 뒀는데, 이건 기록을 다시 처리하는 비용을 내지 않고 작업에 복귀할 수 있는 시간이 너무 짧다는 뜻이야. 긴 휴식 후에 작업으로 돌아오거나 유휴 상태인 서브 에이전트를 여러 개 깨우려면 기록을 다시 처리해야 할 수도 있거든.
캐시 미스: 똑같은 기록을 다시 처리하는 데 2달러—추가로 1.80달러가 더 드는 셈이지.
에이전트 10개가 캐시 미스를 낸다면: 새로운 결과물을 생성하기도 전에 2달러가 아니라 20달러가 나가는 거야.
추론 강도를 높이면 할당량을 덜 쓸 수도 있어.Seth Rose가 X에 올린 글을 보면, Astra High/XHigh로 복잡한 멀티 에이전트 워크플로우를 돌리는 사용자들이 Light/Medium을 쓰는 자기보다 할당량을 훨씬 적게 소모하고 있었대. 레딧의 한 Pro 20x 구독자도 Medium에서는 사용량이 빠르게 늘었는데, XHigh로 바꾸고 나서는 한 시간 동안 1~2%밖에 안 썼다고 하더라고. 그러니까 OpenAI가 추론 강도를 낮추라고 권장하는 게, 경우에 따라서는 일을 끝내는 데 드는 총비용을 오히려 늘릴 수도 있다는 거지.
ARC Prize 평가를 보면 추론 강도를 높이는 게 어떻게 전체 작업 비용을 낮추는지 잘 보여줘.
구독자들은 더 구린 제품 경험을 하고 있고, Codex에는 아직 해결 안 된 문제가 산더미야:
느려 터진 응답:Youssof Al Toukhi가 측정한 결과에 따르면, 같은 추론 설정에서 API는 81 TPS(초당 토큰 수)가 나오는데 Pro는 36 TPS밖에 안 나왔어. 구독자용 Fast 모드도 71 TPS가 한계였고.
Pro 모드 부재: 내 Pro 구독에는 아직 Codex에서 Pro 모드가 안 떠. API는 지원하는데도 말이야.
느린 접근성: OpenAI는 더 성능 좋은 내부 모델을 가지고 있는데, Astra는 구독자들보다 특정 조직에 먼저 풀렸어. 돈 내고 구독한다고 최신 기능을 제일 먼저 써볼 수 있는 게 아니라는 거지.
서브 에이전트의 쓸데없는 폴링: Astra는 유용한 결과를 기다리는 대신 계속 서브 에이전트를 확인해. 나도 이거 겪어봤는데, 어떤 레딧 사용자의 로그 분석을 보면 약 30초 간격으로 47번이나 빈 체크를 하면서 713만 개의 입력 토큰을 처리했더라고. 대부분 캐시된 거였는데, 그냥 워커가 아직 돌아가고 있는지 확인하려고 그 난리를 친 거야. 아무런 생산적인 작업 없이 똑같은 기록을 계속 읽어대니 캐시 히트가 나도 할당량만 잡아먹는 거지.
고장 난 원격 제어: 원격 제어는 진짜 최악이야. 지난 몇 주 동안 앱에서 실행 중인 Codex Desktop 채팅을 열려고 하면 계속 에러만 뱉어내.
토큰만 잡아먹는 메모리: 내가 써본 바로는 Codex는 불필요한 정보를 저장하느라 토큰만 낭비하고, 정작 품질 개선은 하나도 안 돼. Claude Code를 다룬 Theo의
코딩 에이전트 메모리 관련 영상
에서도 낡고 쓸모없는 정보가 쌓이는 문제에 대해 똑같은 우려를 제기하더라고.
OpenAI는 사용자랑 제품에 좀 더 신경 써야 해. 내가 써본 바로는 Codex CLI는 아직 Claude Code보다 한참 뒤처져 있어. 나는 OpenAI가 하니스(모델 주변의 소프트웨어)를 개선하고, 일반적인 워크플로우에서 캐시를 유지해주고, 이런 작업에 드는 비용을 투명하게 공개했으면 좋겠어. DeepSeek 같은 다른 회사들은 모델 접근 비용을 최대한 낮추려고 노력 중이야. DeepSeek는 오픈 소스 하니스인 DSH를 가지고 있고, 캐시된 접두사를 재사용해서 사용자 비용을 줄여주는 인프라도 갖췄거든. OpenAI는 저렇게 앞서나가면서도 구독자 사용량 가지고 장난질이나 치고 있고. 나는 그 노력을 제품을 더 좋고 저렴하게 만드는 데 썼으면 좋겠어.
이런 측정치를 공개적으로 공유하는 게 중요하다고 본다. 유저들끼리 정보를 공유하지 않으면, 이런 변화는 아무도 모르게 넘어가서 그냥 당연한 게 되어버리거든. Codex는 요청할 때마다 주간 사용 한도를 알려준다. 그 업데이트 내용이랑 세션 로그에 찍힌 토큰 수를 대조해보면, API 사용량에 따른 비용 소모를 쉽게 추적할 수 있다. 아니면 Sac의 분석 방식을 써도 되고. 다들 이 글을 공유하고 추천 좀 눌러줬으면 좋겠다. 방법론에 대해 궁금한 게 있거나 직접 수치를 확인해보고 싶다면 언제든 도와줄 테니 말해라.
세 줄 요약
사용 한도 감소: 내가 쓰는 Pro 20x 계정 두 개 다, 주간 API 상당 사용 한도가 GPT-5.6 Sol 시절 2,500달러 이상에서 GPT-6 Astra로 넘어오면서 약 1,200달러 수준으로 떡락했다.
이미 인상된 가격 반영: 저 달러 수치는 이미 Astra의 비싸진 API 가격을 적용한 거다. 즉, 사용 한도 축소는 별개의 추가 너프라는 소리다.
실질 사용량은 4분의 1 토막: 가격 인상이랑 한도 축소까지 합치면, 같은 구독료를 내고도 예전의 4분의 1 정도밖에 못 쓰는 꼴이다.
캐시 읽기(이전 작업)로 낭비되는 한도 증가: 캐시 유지 설정이 엄청나게 짧아졌다. Codex의 Sol은 24시간이었는데 Astra는 30분밖에 안 된다. Codex 캐시 오류까지 겹치면, 긴 작업 내역을 처음부터 다시 처리해야 하는 상황이 생긴다. 에이전트 기반의 긴 작업에서 비용이 가장 많이 나가는 부분이 바로 그 내역을 다시 불러오는 거다.
주요 댓글
r/codex
사용자들은 GPT-6 Astra의 비효율적인 캐시 관리와 과도한 토큰 소모로 인해 구독 가치가 크게 하락한 것에 대해 강한 불만을 표하며, OpenAI가 제품 최적화보다 다른 곳에 자원을 낭비하고 있다고 비판하고 있습니다.
31
혹시 Sol이 Astra 출시 전 광기에서 벗어나 '정상'으로 돌아왔는지 아는 사람?
19
Sol은 안 써봤음. Astra가 사용량 제한 빼고는 너무 좋아서 Sol 쓸 이유가 없음. Astra low/medium이 Sol ultra보다 모든 면에서 나음.
7
맞음, 나도 Astra-medium 이상 써본 적 없음. 뭐, 사용량 때문에 겁나기도 하고 ㅋㅋ
2
더 좋다는 건 의심할 여지가 없지.
하지만 Astra가 정해진 한도 내에서 Sol 단독이나 Sol + Astra 조합보다 더 많은 작업을 더 잘 처리할 수 있을지는 훨씬 흥미로운 질문이라고 생각해.
2
다들 Astra로 이런 결과가 나오는데 나만 왜 이러는지 모르겠네. Astra는 내가 뭘 시키든 매번 놀라울 정도로 실패함. 뭔가 하긴 하는데, 내가 시킨 건 절대 안 함.
예를 들어, 계속 실패하길래 프롬프트에 감정을 좀 섞어서 써봤거든? 그랬더니 내가 요구한 건 무시하고 내 감정에 대해서만 떠들더라. 진짜 어이가 없어서.
6
내 경우엔 Astra 출시 이후로 Sol이 개판이 됐고 아직도 복구가 안 됨.
2
나도 마찬가지임. 전에는 한 번도 제한에 걸린 적 없었는데, 이제는 프롬프트 몇 번 날리면 끝남.
2
어제 Astra 써보고 나서 잠깐 Sol을 써봤는데 2023년형 ChatGPT 쓰는 느낌이더라. 그냥 "너 그거 확실해?"라고 한마디만 해도 20분 넘게 고민했던 내용을 완전히 뒤집어버림. Astra는 똑같이 물어봤을 때 훨씬 자신감 있어 보이더라(그 hallucination 벤치마크가 맞는 말일지도). 뭐 내가 잘 모르는 분야에서 그냥 대충 코딩하는 'vibecoding' 중이긴 했지만, Sol 처음 나왔을 때 이 정도는 아니었던 걸로 기억하거든. 그냥 내가 편견을 가진 건가 싶기도 하고…
난 Claude랑 Codex 둘 다 20달러 플랜 쓰고 있는데, 토큰 가치 비교가 완전히 망가진 느낌임. Claude CLI 통계 보면 Sonnet + Opus로 5시간 단위 3개 돌리면서 하루에 10억 토큰까지 쉽게 처리하는데, 5.6 Terra + Sol은 캐시 히트 고려해도 하루 2억 토큰 정도에서 끊김. Codex가 같은 월 비용으로 Claude보다 토큰 처리량이 훨씬 적음. 나만 이런 거임?
3
응 나도 똑같음. 여러 단계로 나뉜 프로젝트를 작업 중인데, 한 단계당 Claude에서는 주간 사용량의 약 20% 정도를 쓰는데 Codex에서는 약 60% 정도를 잡아먹음. (둘 다 20달러 요금제 기준). 이건 Claude로는 5시간 세션 2번 정도 할 분량인데 Codex로는 5시간 세션 4번 이상을 써야 한다는 뜻임.
9
오케스트레이터 역할을 하는 Astra 에이전트가 수행하는 '빈' 체크로 인한 캐시 미스와 엄청난 비용(기본 학습 방식이 이를 강력하게 권장하는 것 같음)은 정말 치명적인 문제임. 이런 문제들이 내 사용량을 얼마나 미친 듯이 빨리 태워버렸는지 나중에 알고 나니, 내 구독료와 쌓아둔 리셋 횟수를 도둑맞은 기분임.
물론 'Astra는 OpenAI가 의도한 대로 작동하는 거겠지, 그냥 냅둬보자'라고 생각한 내가 바보지. 하지만 사후에 얼마나 많은 '죽은 토큰 비용'이 발생했는지 알아내는 건 정말 짜증 나는 일임...
4
정말 짜증 나지.
내 글이 누군가에게 도움이 됐다니 다행이네.
하네스를 최적화하면 현재 사용량으로 10~20%는 더 버틸 수 있을 거야. 이것들도 새로운 문제는 아니거든.
내 생각엔 그들은 실제 수학자가 나비에-스토크스 문제를 푸는 데 들어가는 크레딧을 훔쳐서 2천만 달러를 쓰는 게, 제품 개선에 힘쓰는 것보다 더 중요하다고 느끼는 모양이야.
5
tibotattle(tibotattle.com에서 설치) 돌려서 본인이 가진 숫자랑 비교해보면 진짜 궁금할 듯. 프로젝트별, 모델별 사용량을 더 자세히 볼 수 있는 업데이트 곧 내놓을 거라 어디서 사용량이 나가는지 알 수 있을 거임. Sol이 사실 가격 효율이 엄청 좋은 편이고, API 대비 효율이 떨어지는 건 다른 모델들(Astra 포함)이라서 하는 말임. 혹시 돌려보면...
4
GPT-5.6 Sol이 24시간 캐시를 썼다는 주장은 좀 확실치 않은 듯. 예전에 본 기억은 나는데, 그건 GPT-5.6 출시 때나 그 직후에 바뀐 걸로 알고 있음. 그 자료에 있는 로그가 7월 9일 거니까, 5.6 캐시 정책이 바뀌던 시기였을 가능성이 높음.
4
맞아, 그 캐시 주장은 근거가 좀 빈약함. '30분 vs 24시간'은 실제 관측된 캐시 수명이 아님. 그건 그냥 유지 모드나 자격 보증일 뿐이지, Astra가 항상 30분 만에 만료되고 Sol이 항상 24시간 유지된다는 증거는 아님.