Pro 20x 계정 5개 중 2개 성능 저하: Astra 비교와 OpenAI의 대응
Five Pro 20x accounts, two persistently degraded: Astra comparisons and OpenAI’s response
핵심 요약
일부 계정의 성능이 예고 없이 저하되는 '섀도우밴' 현상과 그에 대한 OpenAI의 불투명한 대응을 고발하는 글입니다.
- 성능 저하 의혹 — 특정 계정에서 Astra 모델의 결과물 품질이 급격히 떨어지는 현상 발생
- 섀도우밴 가능성 — OpenAI가 계정 활동을 이유로 모델을 몰래 하위 버전으로 라우팅한다는 의심
- 공식 입장 논란 — OpenAI는 계정별 제한이 있을 수 있다고 인정했으나 구체적인 기준은 비공개
- 투명성 요구 — 사용자들은 모델 성능 저하에 대한 명확한 고지와 검토 절차 마련을 촉구함
다들 안녕. 여기서 유용한 정보랑 테스트, 실무 경험 공유해 줘서 진짜 고맙다. 덕분에 나만 이런 문제 겪는 게 아니라는 걸 알게 됐어.
내 모국어가 영어가 아니라서 실력이 좀 부족해. 그래서 AI 도움을 받아서 이 글을 정리했어. 아래 적힌 경험은 전부 내 실제 경험담이야.
본론 들어가기 전에 OpenAI한테도 할 말은 해야겠어. 딱히 화가 난 건 아니야. 나도 Pro 20x 계정을 5개나 쓰고 있으니까, 자동화된 남용 탐지 시스템이 이걸 사이버 공격이나 비정상적인 사용으로 보고 차단할 수도 있겠다는 생각은 들어. 그렇다고 내 계정이 왜 정지당했는지 정확한 이유를 아는 건 아니지만 말이야. 근데 내가 읽어본 다른 글들 보면, 고작 계정 2개(Pro 하나, 백업용 Plus 하나) 쓰던 사람들도 똑같이 당했더라고.
지금 업무량이 엄청나고 마감 기한도 빡빡한 상황이야. 계정 5개 돌려가면서 공유 중앙 소프트웨어 라이브러리 설계하고, 복잡한 신규 장치 6개에 들어갈 펌웨어까지 다 개발했어. 얘네들은 다 하는 일도 다르고, 돌아가는 프로세서도 다르고, 서로 통신까지 해야 하는 애들이거든.
심지어 실제 물리 테스트 벤치에서 생각할 수 있는 모든 시나리오를 다 돌려봤어. 외부 입력이랑 방해 요소까지 다 넣어서 테스트하면서 버그도 엄청나게 잡았지.
서버에 부하 줘서 미안하다. 이 글 베스트 댓글이 뭔지 벌써 눈에 선하네. “아, 그래서 서버가 터졌구나!” =) 근데 그 정도 용량 안 썼으면 마감 못 맞췄을 거고, 나 믿고 있는 사람들 다 엿 먹일 뻔했어. 결국 우리 다 주변 사람들 실망 안 시키고 회사 어떻게든 살려보려고 발버둥 치는 거잖아.
이런 상황에서 내 계정 2개가 https://www.reddit.com/r/codex/comments/1wmenzi/same_model_different_capabilities_on_different/에 올라온 ‘계정마다 성능 다른 문제’랑 똑같은 증상을 보이기 시작했어. 모델은 그대로인데 갑자기 성능이 확 떨어지더라고. 한 번에 하나씩 계정이 맛이 갔고, 그 뒤로 예전 성능으로 돌아오질 않아.
내가 여기서 **“섀도우밴(shadowban)”**이라고 부르는 건 바로 이런 지속적인 변화를 말하는 거야. 계정 접속은 되는데, 아무런 통보도 없이 은근슬쩍 제한을 걸어버리는 거 말이지. 내 입장에서 보이는 상황이 딱 이거라 이렇게 부르는 거지, 내부 메커니즘까지 내가 확인할 방법은 없어.
내 관찰 결과는 크게 두 가지야.
-
문제 생긴 계정 2개: 성능이 갑자기 뚝 떨어졌고, 회복될 기미가 안 보임.
-
멀쩡해 보이는 계정 3개: 아직 쓸만하긴 한데, 똑같이 Astra에 추론 강도 설정 맞춰놓고 돌려봐도 펠리컨(pelican) 결과물 퀄리티가 눈에 띄게 다름.
두 번째 포인트 때문에 단순히 ‘제한됨 vs 제한 안 됨’으로 나뉘는 게 아니라 상황이 훨씬 복잡할 수도 있겠다는 생각이 들어. 멀쩡한 계정들 사이에서도 요청이 서로 다른 모델 구성이나 성능 수준으로 전달되는 거 아닐까 싶어. 이건 그냥 내 가설일 뿐이고, 결과물만 보고 증명할 수 있는 건 아니야.
가끔 멀쩡한 계정에서 Astra가 2025년 7월 지식 컷오프라고 대답하는 경우도 봤어. 모델이 자기 자신을 잘못 설명할 수도 있다는 건 알지만, 어쨌든 다른 모델로 라우팅되고 있을지도 모른다는 의심이 더 커지네. 컷오프 날짜 하나만 가지고 어떤 모델이 응답했는지 확정 지을 수는 없지만 말이야.
퀄리티 차이를 보여주려고 설정에서 똑같은 프롬프트로 채팅 두 개를 비교해 봤어.



