원시인 클로드(Caveman Claude) - 요약: 작동 안 함! 그 이유
Caveman Claude - TDLR; IT IS NOT WORKING! AND WHY
핵심 요약
원시인처럼 말하게 해서 토큰을 아끼려는 'Caveman Claude' 핵은 오히려 비효율적이며, 워크플로우 최적화가 훨씬 중요하다는 주장.
- 토큰 절약의 허구 — 원시인 말투는 오히려 입력 토큰을 늘리고 추론 품질을 저하시킴.
- 이미 최적화된 프롬프트 — Claude Code는 이미 간결하게 응답하도록 설정되어 있음.
- 비용 절감의 핵심 — 프롬프트 핵보다 모델 계층 구조를 활용한 워크플로우 설계가 훨씬 효과적임.
- 잘못된 최적화 — 텍스트 출력보다 툴 호출과 컨텍스트 관리가 토큰 비용의 대부분을 차지함.
아마 이 트윗(X에서 280만 조회수)을 보셨을 겁니다:
https://x.com/om_patel5/status/2040279104885314001?s=20
그래서 저는 Claude가 원시인처럼 말하게 만들어 토큰을 75% 절약한다고 주장하는 "Caveman Claude" 핵을 분석해 봤습니다.
"I executed the web search tool" (8 토큰) → "Tool work" (2 토큰)
그럴듯해 보이죠. 하지만 숫자를 들여다보면 실제로 일어나는 일은 다음과 같습니다:
1/ Claude Code는 이미 이렇게 하고 있습니다.
시스템 프롬프트에는 말 그대로 이렇게 적혀 있습니다: "Go straight to the point", "Keep your text output brief and direct", "If you can say it in one sentence, don't use three."
여러분은 이미 '원시인-라이트' 버전을 실행 중인 겁니다. 이미 최적화된 것에 지침을 더 추가해 봐야 효율은 떨어질 뿐입니다.
2/ 텍스트 출력은 토큰이 소모되는 곳이 아닙니다.
어떤 실제 에이전트 워크플로우에서든 토큰 비용의 90% 이상은 다음에서 발생합니다:
- 툴 호출 (파일 읽기, grep, bash 명령어)
- 컨텍스트 윈도우 (메모리에 로드된 파일 내용)
- 시스템 프롬프트, CLAUDE.md, 대화 기록
Claude가 "Tool work"라고 말하는 것과 "I executed the search"라고 말하는 것은 전체 소모량의 1~2% 정도입니다. 여러분은 잘못된 부분을 최적화하고 있는 겁니다.
3/ 원시인 지침은 입력 토큰을 추가합니다.
아무도 말하지 않는 부분입니다. 원시인 프롬프트 자체가 모든 대화의 입력 토큰으로 로드됩니다. 출력 메시지당 6토큰을 아낄 수는 있겠지만, 지침을 로드하는 데 대화당 50개 이상의 추가 입력 토큰을 쓰게 됩니다.
많은 경우, 비용을 줄이는 게 아니라 오히려 더 많이 지불하게 될 수도 있습니다.
4/ 추론 품질이 저하됩니다.
모델에게 의사소통을 압축하도록 강요하면, 단순히 군더더기 단어만 빼는 게 아니라 컨텍스트를 놓치기 시작합니다. 뉘앙스나 예외 상황 같은 것들이죠. "이건 작동할 거야"와 "이건 작동하겠지만 X를 주의해야 해" 사이의 차이입니다.
단순한 웹 검색에는 괜찮을지도 모르죠. 하지만 복잡한 다중 파일 리팩토링, 디버깅, 아키텍처 결정에서는요? 그 잃어버린 컨텍스트가 여러분의 시간을 몇 시간씩 갉아먹을 겁니다.
5/ 비용을 90% 이상 줄이는 방법은 무엇일까요?
프롬프트 핵이 아니라 워크플로우 아키텍처입니다.
저는 다중 에이전트 디스패치 시스템을 운영합니다:
- 무료 로컬 모델(Qwen, Gemma)이 단순 작업을 처리합니다.
- 중간급 모델이 일반적인 코딩 및 리뷰를 처리합니다.
- 고가 모델(GPT 5.4, Claude Opus)은 저가 모델이 할 수 없는 작업에만 투입됩니다.
원시인 핵은 100달러 청구서에서 1% 정도를 아껴줍니다. 제대로 된 에이전트 계층 구조를 갖추면 그 100달러 청구서는 10달러가 됩니다.
이 워크플로우를 공유 가능한 Claude Code 스킬로 패키징하고 있습니다. 곧 공개하겠습니다.


