모델 라우팅으로 $200짜리 Max 구독과 동일한 성능을 API로 구현한 후기
I got $200 of direct API usage to perform equal to my $200 Max subscription after I started model routing
핵심 요약
작업 복잡도에 따라 모델을 다르게 사용하는 라우팅 기법을 통해 Claude Max 구독 대비 비용을 85% 절감한 사례
- 비용 효율화 — 단순 파일 읽기나 보일러플레이트 생성 등 저사양 모델로 충분한 작업에 고비용 모델 사용을 줄여 비용을 대폭 절감함.
- 모델 라우팅 — Sonnet과 Opus를 작업 난이도에 따라 자동으로 배분하는 서드파티 라우터를 사용하여 효율을 극대화함.
- 구독 모델의 한계 — Anthropic의 구독제는 토큰 사용량이나 작업별 비용 가시성을 제공하지 않아 비효율적인 지출을 유도함.
- 프로젝트 단계별 차이 — 프로젝트 초기 설계 단계에서는 고성능 모델 비중이 높지만, 유지보수 단계로 갈수록 저사양 모델로도 충분함.
Max 구독을 두 달 동안 써오다가 드디어 내 토큰이 실제로 어디에 쓰이는지 추적해 봤어.
전형적인 하루 사용량 분석:
- ~40% 파일 읽기, git status, 프로젝트 컨텍스트 스캔: Opus가 전혀 필요 없는 작업들
- ~25% 테스트 생성, 스캐폴딩, 보일러플레이트: Sonnet도 똑같이 처리함
- ~20% 포매팅, 이름 변경, 단순 리팩토링: 말 그대로 아무 모델이나 다 됨
- ~15% 실제 고난도 추론, 여러 파일에 걸친 아키텍처: Opus가 필요한 유일한 부분
결국 실제로 프런티어 모델이 필요한 15%를 위해서 한 달에 $200를 내고 있는 셈이야. 나머지 85%는 100만 토큰당 $0.28인 모델로도 충분한 작업에 프리미엄 토큰을 태우고 있는 거지.
라우팅 기능이 있는 API로 갈아탔어. Sonnet을 일상적인 작업에 쓰고, 여러 파일에 걸친 추론이 필요할 때만 Opus를 써. 한 달 비용이 $200에서 API 추가 사용료 포함 약 $30로 줄었는데, 어려운 작업은 여전히 Opus가 처리하니까 결과물 퀄리티는 똑같아.
구독 모델은 이런 사실을 숨기도록 설계되어 있어. 토큰 분석도 없고, 작업별 비용 가시성도 없지. 그저 알 수 없는 이유로 줄어드는 쿼리 제한만 있을 뿐이야.

