Claude 사용량의 대부분은 불필요한 작업이었음. 소형 모델로 단순 반복 작업을 처리해 비용을 60배 절감함.
Most of my Claude usage was on work that didn't need Claude. Cut my bill 60x on bulk tasks with a tiny side model.
핵심 요약
단순 반복 작업에 Claude를 쓰는 대신 저렴한 소형 모델을 연동해 비용을 60배 절감한 사례.
- 비용 절감 전략 — 단순 반복 작업에 고성능 모델 대신 저렴한 모델을 사용하여 비용을 60배 절감함.
- CLAUDE.md 설정 — 긍정적 지시 대신 부정적 지시(Deny list)를 통해 Claude가 단순 작업을 수행하지 않도록 제어함.
- MCP 연동 방식 — DeepSeek V4 Flash를 사이드 워커로 활용하여 Claude가 처리하기엔 아까운 작업을 오프로딩함.
- 실제 성과 입증 — 3주간 217건의 작업을 처리하며 비용을 7달러에서 0.41달러로 낮춤.
내가 실제로 Claude를 어디에 쓰고 있었는지 확인해봤는데 정말 창피하더군요. 파일 분류하기, JSON 재포맷팅, 텍스트에서 필드 추출하기, 어차피 대충 훑어볼 문서 요약하기 같은 작업들이었습니다. 이런 작업들은 Sonnet이 전혀 필요 없는 것들이었죠. 그런데도 Sonnet이 필요한 작업과 똑같은 비용이 들고 있었습니다.
가장 먼저 뻔한 해결책들을 시도해봤습니다. 단순 작업에는 Haiku로 전환해봤지만(여전히 대량으로 쓰면 낭비임), 프롬프트를 더 타이트하게 짜보기도 하고(조금 도움은 됨), /compact를 써보기도 했습니다(문제 해결을 잠시 미룰 뿐). 그 무엇도 지출의 형태를 바꾸지는 못했습니다.
실제로 효과가 있었던 건, Claude에게 기계적인 작업은 직접 하지 말라고 CLAUDE.md에 규칙 하나를 적어두고, 사이드 워커로 작고 저렴한 모델을 돌리는 것이었습니다.
설정은 도구 하나를 쓰는 방식입니다. 텍스트를 보내면 텍스트를 돌려받죠. Claude는 내가 어차피 검토할 기계적인 작업에 대해 이 도구를 호출합니다. 기본 모델은 DeepSeek V4 Flash를 사용하는데, 저렴하고 1M 컨텍스트를 지원하기 때문입니다. 하지만 엔드포인트는 설정 한 줄이면 되고 OpenAI 호환 모델이라면 무엇이든(로컬 ollama, vllm, lm studio 등) 작동합니다.
3주간의 실제 사용 결과:
- 217건의 기계적 작업 오프로딩
- DeepSeek 총 비용: $0.41
- 같은 작업을 Sonnet으로 했을 경우: 약 $7
실제로 효과가 있는 CLAUDE.md 규칙은 부정적 프레이밍입니다. "X에는 DeepSeek를 써라"가 아니라 "다음 작업에는 Claude를 절대 사용하지 마라: JSON 포맷팅, 필드 추출, 파일 분류, 어차피 검토할 요약 작업"이라고 적는 거죠. 긍정적 프레이밍은 30% 정도 무시당했지만, 금지 목록(Deny list)은 확실히 잡아냅니다.
이건 에이전트가 아니라 감독받는 작업자입니다. 도구 호출도, 파일 접근도, 체인도 없습니다. 지연 시간은 3~25초 정도입니다. 당신이 결과물을 검토하는 거죠. 그게 전부입니다.
설정 단계가 포함된 저장소: https://github.com/arizen-dev/deepseek-mcp (MIT, Python 3.10+)
라우팅 규칙이나 모델 선택에 대해 궁금한 점이 있으면 언제든 물어봐 주세요.

