최근 Claude Code의 미친 토큰 사용량과 세션 제한에 대해 이야기해 볼까요?
Can we talk about the INSANE token usage and session limits recently?
핵심 요약
Claude Code 4.7 업데이트 이후 세션 재개 시 발생하는 과도한 토큰 소모와 세션 제한 문제에 대한 불만.
- 세션 재개 비용 — 기존 대화를 다시 시작할 때마다 세션 사용량이 급격히 증가함.
- 업데이트 영향 — 4.7 버전 이후 이전보다 훨씬 빠르게 세션 제한에 도달함.
- 최적화 부족 — 모델 성능 향상보다 토큰 소모가 너무 커서 실사용이 어려움.
- 사용자 경험 저하 — Anthropic이 일반 개발자의 편의를 고려하지 않는다는 의구심이 듦.
4.7 버전이 출시된 이후로 Max 5x 플랜 사용자로서 세션 제한이 악몽이 됐습니다.
대화를 재개할 때 엄청난 세션 사용 비용이 발생하는 건 새로운 현상인데(오래된 대화를 재개하면 즉시 세션 사용량이 크게 뜁니다), 아무도 이 이야기를 안 하네요.
이전 대화를 재개하면 세션 사용량이 즉시 10~20%로 점프합니다. 한 번은 긴 대화에 답장을 하려다가 세션 사용량이 30%를 넘겨버린 적도 있어요. 이게 지수적으로 늘어나서 어느 시점부터는 대화를 이어가는 게 불가능해집니다. 참고로 이전 모델들에서는 훨씬 깊이 있는 대화를 나눠도 전혀 문제가 없었습니다.
분명히 말하지만, 저는 Max 5x 플랜을 쓰고 있고 4.7 출시 전에는 제한에 걸린 적이 거의 없었습니다. 4.6 버전에서는 속도가 느려서 세션 제한을 걱정할 필요가 없었죠. 4.5는 더 좋았고요. 그런데 4.7에서는 세션 사용량이 올라가는 걸 불안하게 지켜보고 있고, 메시지 하나당 평균 1~3%씩 비용이 드는데 이건 진짜 미친 짓입니다!!!!!!
이게 대체 어디로 가고 있는 걸까요?
GPT-5.5로 'superpowers:brainstorm' 스킬을 사용해 사양 기반 개발 작업을 해보기도 했습니다. 작업의 30%를 끝내는 데만 45분이 걸렸고, 세션 도중에 5시간 제한에 걸려버렸습니다. 작업 내용도 특별할 게 없었는데요. 낮은 추론 모드를 쓰지 않는 이상 말 그대로 사용 불가능한 수준입니다.
AI 모델들은 점점 더 무거워지는데 성능은 미세하게만 좋아지고 있습니다. 왜죠? 최적화도 중요한데, AI 모델이 토큰을 아무렇지 않게 잡아먹지 않았으면 좋겠어요. 저는 너프되지 않은 Opus 4.6이 정점(아니면 4.5)이었다고 생각하고, 앞으로는 내리막길만 남았다고 봅니다.
제 생각엔 Anthropic과 OpenAI가 뭘 하든 간에 일반 개발자의 경험 따위는 신경 쓰지 않는 것 같습니다. 이게 어디로 가는지 모르겠지만, 뭔가 수상해요.


