더 나은 컨텍스트 관리로 Claude 비용 80% 절감하는 법
how to save 80% on your claude bill with better context
핵심 요약
Claude API 사용 시 토큰 비용을 획기적으로 줄일 수 있는 데이터 최적화 및 컨텍스트 관리 전략 공유.
- 데이터 전처리 — HTML 대신 Markdown을 사용하고 Firecrawl 등으로 불필요한 태그를 제거해 토큰 사용량을 줄임.
- 컨텍스트 관리 — 200k 토큰 제한을 고려하고, 프롬프트 캐싱을 활용해 데이터 일관성을 유지함.
- 비용 최적화 — Haiku 모델로 사전 요약하거나, 불필요한 컨텍스트를 잘라내어 고성능 모델의 비용 부담을 낮춤.
- 안전 장치 — Anthropic 콘솔에서 사용량 제한을 설정해 예기치 못한 과도한 비용 발생을 방지함.
최근 Claude로 웹 앱을 만들고 있는데 토큰 제한 때문에 골머리를 앓기 시작했음. 연구용 툴에 Claude 4.6 Sonnet을 쓰고 있는데, 원시 웹 데이터를 그대로 집어넣으니 제한에 금방 걸려버림.
토큰을 아끼고 비용을 줄이기 위해 실제로 효과를 본 방법들을 정리해봤음:
먼저 Markdown으로 전환하셈. 원시 HTML을 보내지 마셈. Firecrawl 같은 툴을 써서 중첩된 div나 스크립트 찌꺼기를 제거하면 실제 텍스트에 대해서만 비용을 지불하면 됨.
프롬프트 캐시를 식히지 마셈. Anthropic의 프롬프트 캐싱은 정말 큰 도움이 되지만, 데이터가 일관적일 때만 작동함.
200k 토큰 "프리미엄" 점프를 조심하셈. Anthropic은 이제 새로운 Opus/Sonnet 4.6 모델에서 200k 토큰이 넘는 입력에 대해 거의 두 배의 요금을 부과함. 추가 요금을 피하려면 컨텍스트를 그 제한 아래로 유지하셈.
내비게이션과 푸터를 제거하셈. 웹사이트의 "회사 소개"나 "채용 정보" 같은 푸터 링크는 메시지를 보낼 때마다 돈을 태우는 거나 다름없음.
빠른 확인은 Jina Reader를 쓰셈. 단순한 단일 페이지 읽기에는 Jina가 크롤러의 군더더기 없이 깔끔한 텍스트 버전을 얻기에 아주 좋음.
컨텍스트를 잘라내셈. 문서 페이지가 20k 단어라면 그냥 앞의 5k만 가져오셈. 대부분의 "핵심"은 보통 앞부분에 있으니까.
Unstructured.io로 데이터를 정리하셈. 웹 데이터와 함께 지저분한 PDF를 다룰 때, 이 툴을 쓰면 Claude가 이해할 수 있는 깔끔한 스키마로 변환해줌.
크롤링 전에 매핑하셈. 모든 하위 페이지를 무작정 긁지 마셈. 나는 Firecrawl의 맵 기능을 써서 프롬프트에 실제로 중요한 특정 문서 URL만 찾아냄. 다른 툴을 쓴다면 이런 방식을 선호하셈.
"쓰레기" 작업에는 Haiku를 쓰셈. Opus 같은 비싼 모델에 데이터를 넣기 전에 Claude 4.5 Haiku를 써서 데이터를 요약하거나 필터링하셈.
스마트 청킹을 하셈. Llama-index를 써서 데이터를 의미 단위로 쪼개면, AI가 특정 프롬프트에 필요한 정확한 문단만 검색하게 할 수 있음.
"확장된 사고(Extended Thinking)" 깊이를 제한하셈. Opus 4.6의 경우, thinking: {type: "adaptive"}와 effort: "low" 또는 "medium"으로 설정하셈. 예전 budget_tokens 파라미터는 4.6에서 더 이상 안 쓰임. 사고 토큰은 출력 요금으로 청구되니까, effort를 high로 두면 Claude가 단순한 질문에도 매번 깊게 생각해서 비용이 엄청나게 나올 거임.
하드 사용 제한을 설정하셈. Anthropic 콘솔에서 지출 한도를 설정해두면 자는 동안 버그가 난 루프 때문에 은행 계좌가 털리는 일을 막을 수 있음.
내 설정에 대해 마음껏 비판하거나 더 좋은 팁이 있다면 공유해주셈.


