토큰 경제학
Token Economics
핵심 요약
Claude 사용 시 토큰 제한을 피하고 효율적으로 대화 컨텍스트를 관리하는 실전 팁 공유.
- 대화 관리 — 긴 대화는 컨텍스트 재처리 비용을 높이므로 주기적으로 요약 후 새 대화 시작함.
- 프롬프트 최적화 — 수정 사항은 새 메시지 대신 원본 프롬프트를 수정하여 토큰 낭비를 줄임.
- 작업 배치 — 여러 단계의 작업을 한 번에 처리하여 컨텍스트 로드 횟수를 최소화함.
- 기능 선택 — 검색이나 도구 사용 등 불필요한 부가 기능은 끄고 필요한 모델만 선택함.
꽤 오랫동안, 나는 문제가 Claude에 있다고 생각했다.
극적인 이유는 아니었다. 그냥 평소의 좌절감이었다. 나는 너무 빨리 제한에 걸렸고, 제대로 된 일을 끝낼 수 없다고 느꼈으며, 솔직히 모델이 무거운 사용량을 감당하도록 만들어지지 않았다고 생각했다. 내 첫 번째 본능은 '아마 더 큰 플랜이나 더 나은 접근 권한이 필요할 것 같다'는 것이었다.
하지만 더 많이 사용하고 실제로 무슨 일이 일어나고 있는지 주의를 기울인 후, 나는 내가 잘못된 것을 보고 있었다는 것을 깨달았다.
제약은 모델 자체가 아니다. 토큰이 어떻게 사용되고 대화가 백그라운드에서 어떻게 계속 커지는지가 문제다.
그게 나에게는 전환점이었다.
대부분의 사람들(나를 포함해서)이 깨닫지 못하는 것은, 시스템이 우리가 생각하는 방식으로 메시지를 세지 않는다는 점이다. 당신이 무언가를 보낼 때마다, 시스템은 전체 대화 기록을 다시 처리한다. 그래서 채팅이 길어질수록, 각 새 메시지는 더 많은 비용이 든다.
즉, '진전'이라고 느껴지는 많은 것들이 사실은 이전 컨텍스트를 계속해서 다시 처리하는 것뿐이다.
그걸 알아차리기 시작하자, 몇 가지가 분명해졌다.
첫째—후속 질문을 쌓는 것은 비싸다.
나는 예전에 '그게 내 뜻이 아니었어'나 '다시 말해볼게' 같은 수정 사항을 계속 보냈다. 하지만 그럴 때마다 기록이 더 추가된다. 이제 나는 그냥 원래 프롬프트를 수정하고 다시 생성한다. 작은 변화지만, 예상보다 훨씬 많은 비용을 아껴준다.
둘째—긴 채팅은 효율적이지 않다.
15~20개 정도의 메시지가 지나면, 당신은 이미 말한 내용을 시스템이 다시 읽게 하는 데 대부분의 비용을 지불하고 있는 것이다. (적어도 나에게는) 더 효과적인 방법은 다음과 같다: 중요한 내용을 요약하고, 새 채팅을 시작하고, 거기서부터 이어가는 것이다. 중요한 것을 잃지는 않지만, 불필요한 무게를 많이 덜어낼 수 있다.
셋째—단계별보다는 일괄 처리가 더 낫다.
나는 예전에 작업을 여러 프롬프트로 나누곤 했다(요약 → 수정 → 확장). 하지만 그건 매번 컨텍스트를 다시 로드할 뿐이다. 이제 나는 작업들을 하나의 프롬프트로 결합하려고 노력한다. 더 빠르고, 저렴하며, 솔직히 모델이 전체 의도를 미리 파악하기 때문에 결과물도 보통 더 좋다.
또 다른 점—컨텍스트 재사용이 생각보다 중요하다.
같은 파일을 다시 업로드하고, 지시사항을 반복하고, 선호도를 다시 말하는 것—이 모든 것이 합쳐진다. 매번 컨텍스트를 새로 만들지 않고 더 의도적으로 관리하기 시작하자, 모든 것이 더 원활해졌다.
또한—기능은 '공짜'가 아니다.
검색, 도구, 더 무거운 추론 모드—이 모든 것이 오버헤드를 추가한다. 필요하지 않다면 끄고 사용한다. 모델도 마찬가지다—단순한 작업에 무거운 것을 사용할 이유가 없다.
타이밍도 예상치 못하게 중요한 요소였다.
사용량은 깔끔하게 초기화되는 것이 아니라 롤링 윈도우 방식으로 작동한다. 한 번에 모든 것을 다 써버리면, 나중에 막힌 기분이 들 것이다. 작업을 분산하는 것이 생각보다 훨씬 도움이 된다.
그리고 그래—대안이 있으면 도움이 된다.
작업 도중에 끊기는 것은 좌절스럽다. 그냥 백업 계획(심지어 마음속으로라도)을 가지고 있는 것만으로도 차이가 생긴다.
토큰과 컨텍스트라는 관점에서 생각하기 시작하면, 단순히 메시지 단위로 생각할 때보다 훨씬 예측 가능해지고, 솔직히 훨씬 덜 좌절하게 된다.


