로컬 LLM을 서브 에이전트로 사용하여 작업당 컨텍스트 30배 절감
30x less context per task by using a local LLM as a subagent
핵심 요약
로컬 LLM을 Claude Code의 서브 에이전트로 활용해 토큰 사용량을 획기적으로 줄이는 방법 공유.
- 컨텍스트 효율성 — 로컬 LLM을 서브 에이전트로 활용해 Claude의 토큰 사용량을 30배가량 절감함.
- 구현 방식 — LM Studio를 통해 Qwen 3.6 모델을 연동하여 Claude Code에서 /ask-local 명령어로 호출함.
- 성능 비교 — 복잡한 인벤토리 작업에서 Opus 단독 사용 대비 토큰 비용을 대폭 낮추면서도 품질을 유지함.
- 하드웨어 요구사항 — 64GB RAM 환경에서 64k 컨텍스트 윈도우를 지원하는 모델 구동이 권장됨.
u/Ok_Significance_9109의 원본 포스트에서 로컬 LLM을 Claude Code 서브 에이전트로 실행하는 방법이 며칠째 유용하게 쓰이고 있습니다. 저는 스크립트를 가져와 실제 작업에 사용했고, Claude는 제대로 작동할 때까지(그리고 오류가 멈출 때까지) 계속해서 코드를 수정했습니다.
간단히 말해서, LM Studio에 Qwen 3.6을 로드했고 /ask-local을 사용하여 추출, 인벤토리, 감사 등을 수행할 수 있습니다. 무료 Haiku 에이전트를 쓰는 것과 같습니다. 테스트 결과는 다음과 같습니다:
|Task|Files involved|Opus 4.7 direct|Ask-local|Per-task ratio|
|:-|:-|:-|:-|:-|
|Inventory every route under app/api/admin: method, path, auth check, purpose, DB tables|23 route files|13k marginal (62k total)|0.4k marginal (49.4k total)|~30×|
|Full page inventory of an Astro site: H1, H2s, meta, CTA, disclaimer per page + layout details + consistency review|18 files (14 pages + 4 layouts)|89k marginal (138k total)|3k marginal (52k total)|~30×|
차트의 총계에는 새 세션이 로드될 때마다 항상 포함되는 일반적인 시스템 프롬프트/claude.md 내용(제 경우에는 49k)이 포함되어 있다는 점을 참고하세요. 따라서 작업 자체는 Opus가 단독으로 수행했을 때의 13k/89k 토큰과 비교하여 0.4k/3k Opus 토큰만 사용했습니다. 여러 번 사용하는 작업 세션에서는 확실히 큰 비용을 절약할 수 있습니다.
품질 면에서 Qwen과 Opus는 위 테스트에서 서로 다르지만 중복되는 일관성을 보여주었습니다. Qwen은 Opus가 놓친 아키텍처 문제를 잡아냈고, Opus는 Qwen이 놓친 헤딩 계층 구조 문제를 잡아냈습니다. 어느 쪽이 더 낫다고 할 수는 없으며, 단지 서로 다른 부분을 발견했을 뿐입니다.
더 자세한 정보는 저장소에 있습니다: https://github.com/alisorcorp/ask-local
OpenAI 호환 로컬 서버라면 어디서든 실행됩니다. 64GB M4 Max에서 unsloth의 Qwen3.6-35B-A3B-MXFP4_MOE gguf로 테스트했습니다. 좋은 성능을 위해서는 64k 컨텍스트 윈도우가 필요합니다.

