Claude Max 20x에서 5x로 다운그레이드: 로컬 27B 모델(RTX 5060 Ti 2개)로 에이전트 작업의 절반을 이전한 후기. 라우팅 매트릭스, 손익분기점 계산 및 조언 구함
Downgraded Claude Max 20x -> 5x after moving the "derivable" half of my agent work to a local 27B on 2x RTX 5060 Ti. Routing matrix, break-even math, and where I'd like advice
핵심 요약
로컬 모델과 클라우드 에이전트를 적절히 분배하는 라우팅 매트릭스를 구축하여 Claude 구독 비용을 4분의 1로 절감한 사례입니다.
- 라우팅 매트릭스 — 작업 난이도에 따라 로컬(Qwen 27B)과 클라우드(Opus/Haiku) 모델을 엄격하게 분리하여 운영함
- 비용 절감 효과 — 로컬 모델 활용으로 Claude Max 구독을 20x에서 5x로 낮추고 GPU 투자 비용을 13개월 내 회수함
- 하드웨어 고민 — GPU 가격 급등으로 인해 30-120B급 모델 운영을 위한 48-64GB VRAM 확보 방안을 모색함
- 운영 노하우 — 로컬 모델의 한계를 극복하기 위해 테스트 기반 패치, 명확한 프롬프트 지침 등 5가지 안전 수칙을 적용함
2주 전, 내 실제 프로덕션 코드베이스(장기 운영 환경 데이터 플랫폼: Node/Knex/PostgreSQL+Oracle, Svelte, Cypress, 약 1,200개의 e2e 테스트)에서 로컬 Qwen3.8 27B가 뭘 할 수 있고 뭘 못하는지 확인하려고 테스트를 돌려본 결과를 올렸었음. 요약하자면: 도출 가능한 모든 건 로컬로, 판단이 필요한 모든 건 프론티어 모델로 돌리는 게 답이었음.
이번 글은 그 후속편임. 결과적으로 구조가 어떻게 잡혔는지, 그리고 돈값은 하는지 정리해 봄. 덕분에 Claude Max 20x 플랜에서 5x로 낮췄으니까, 확실하게 비교할 수 있는 수치가 나옴. 아래 Anthropic 가격은 내가 실제로 내는 이탈리아 부가세 22%가 포함된 금액임. 세전 금액으로 계산하고 싶으면 알아서 빼셈.
1. 구조: 누가 뭘 하는가
전체 시스템은 라우팅 매트릭스임. 모든 작업은 등급(R1~R9)이 매겨지고, 그 등급에 따라 모델이 결정됨. 기분 내키는 대로 쓰는 게 아님. 이 매트릭스는 리포지토리 내 마크다운 파일로 관리되는데, 사람이든 세션 모델이든 뭐 좀 복잡한 거 시작하기 전에 무조건 이거부터 읽음.
-
SESSION: Opus 5(일일), Fable 5.1(감사 및 캠페인용). 질문 처리, 마이크로 픽스, 캠페인 계획, 감사 판정, DB 및 되돌릴 수 없는 작업, 레이스 컨디션 버그 등을 담당함. 위임 가능한 단순 작업은 절대 안 시킴.
-
LOCAL: Qwen3.8 27B UD-Q6_K, 131K 컨텍스트, 2x 5060 Ti에서 llama-server 구동. 파일:라인 증거를 기반으로 한 조사, 문서화된 패턴에 따른 구현, 단순 반복 작업, 테스트 분류, 계획 및 감사 기초 작업 등, 기기 밖으로 나가면 안 되는 모든 작업을 수행함. 결정, 판정, DB 작업, 공식 계획 수립은 절대 안 시킴.
-
ECO: Haiku 4.5. 6개의 클라우드 병렬 처리가 GPU 1개보다 빠를 때, llama-server가 죽었을 때, 혹은 로컬 패치용 bash 가드 러너로만 사용함. 긴 툴 루프가 필요한 작업은 절대 안 시킴.
-
HIGH/MAX 서브 에이전트: Opus 5(플래너), Fable 5.1(블라인드 감사자). 로컬에서 2번 실패하면 에스컬레이션, 계획 작성, 계획에 대한 블라인드 재검증을 담당함.
원래 Sonnet을 중간 티어로 썼었는데, 이제 뺌. 테스트로 검증되는 패턴 기반 구현에서는 Qwen+테스트 조합이 Sonnet만큼 잘했고, Sonnet은 최상위 티어랑 똑같이 구독료만 잡아먹었거든. 이제 LOCAL에서 막히면 바로 Opus로 넘김.





