Fable 5 출시로 에이전트 개발자들에게 필수화된 비용 인식 모델 라우팅
Fable 5 just made cost-aware model routing mandatory for agent builders
핵심 요약
Anthropic의 고성능 모델 Fable 5의 높은 비용으로 인해 에이전트 설계 시 효율적인 모델 라우팅과 비용 관리가 필수가 되었습니다.
- 비용 급증 위험 — 에이전트의 복잡한 작업 수행 시 토큰 사용량이 폭증하여 비용 부담이 커짐
- 모델 라우팅 필수 — 작업 난이도에 따라 모델을 선택하는 라우터 도입이 아키텍처의 핵심이 됨
- 비용 관측 강화 — 호출당 비용이 아닌 작업당 비용을 추적하여 예산 낭비를 방지해야 함
- 경제적 의사결정 — 이제 모델 선택은 설정값이 아닌 매 단계마다 이루어지는 경제적 판단의 영역임
Anthropic이 오늘 Opus 4.8보다 상위 등급인 Mythos급 모델, Fable 5를 내놨다. 가격은 입력 100만 토큰당 10달러, 출력 100만 토큰당 50달러로 Opus 4.8의 딱 두 배다. 에이전트 만드는 애들은 가격표 보고 쫄 필요 없다.
진짜 쫄아야 할 건 팬아웃(fan-out)이다. 에이전트 시스템에 던지는 사용자 "질문" 하나가 절대 한 번의 완료로 끝나지 않거든. 계획 수립 단계, 서브 에이전트 생성, 도구 호출 루프, 재시도, 자체 검증 과정까지 줄줄이 따라붙으니까. Anthropic이 대놓고 Fable 5를 서브 에이전트 위임이 포함된 며칠짜리 자율 세션용으로 홍보하는 이유가 이거다. 복잡한 요청 하나가 수천만 토큰으로 불어날 수 있는데, 출력 100만 토큰당 50달러면 사용자는 질문 하나 던졌을 뿐인데 청구서엔 수백만 원이 찍히는 꼴이지.
나도 소비자 입장에서 직접 테스트해 봤다. Max 20x 플랜 쓰는데, 빡센 작업 돌리니까 1분마다 사용량 한도의 2%씩 날아가더라. Opus 4.8로 똑같은 작업 돌릴 땐 한도 근처도 안 갔는데 말이야. 모델이 더 길게 생각하고 턴당 출력도 많아서, 실제 작업당 비용은 가격표에 적힌 2배보다 훨씬 높다.
이게 에이전트 아키텍처에 시사하는 점은 이거다:
무조건 제일 좋은 모델만 쓰는 평면적인 접근 방식은 이제 끝났다. 앞단에 라우터가 필수다. 분류, 추출, 단순 연결 작업은 싼 모델(Haiku/Sonnet급) 쓰고, 표준 추론은 중간급, 진짜 최상위 성능이 필요한 단계에만 Fable을 써야 한다. 프롬프트 캐싱(90% 입력 할인)은 그 어느 때보다 중요해졌다. 토큰 예산이랑 작업당 비용 상한선은 나중에 생각할 게 아니라 오케스트레이션 계층에서 최우선으로 고려해야 한다. 호출당 비용이 아니라 작업당 비용을 관찰해야 한다고. 팬아웃 때문에 예산이 살살 녹으니까. Uber가 이 가격대 모델이 나오기도 전에 1년 치 AI 예산을 4개월 만에 다 태워 먹었다는 소문이 괜히 도는 게 아니다.
분명히 말하는데, 모델 성능은 확실히 한 단계 위고 어려운 장기 과제 해결할 땐 제값 할 거다. 하지만 이제 "어떤 모델을 쓸지"는 설정값 한 번 정해두는 게 아니라, 오케스트레이터가 매 단계마다 결정해야 하는 경제적인 문제가 됐다.
다들 라우팅 어떻게 처리하고 있냐? 작업 유형별로 정적 규칙을 박아두냐, 아니면 LLM 판사한테 모델 고르게 시키냐, 그것도 아니면 그냥 비용 감수하고 쓰는 거냐?

