Anthropic이 'Fable 5 오케스트레이션, 저렴한 모델 실행' 패턴을 벤치마킹함: 비용은 46%인데 성능은 96%. Claude Code에서 지금 바로 이 패턴을 실행할 수 있음
Anthropic just benchmarked "Fable 5 orchestrates, cheap models execute": 96% of the performance at 46% of the cost. You can run this pattern in Claude Code today
핵심 요약
Claude Code에서 고성능 모델과 저렴한 모델을 조합해 비용 효율을 극대화하는 멀티 에이전트 패턴 활용법을 공유함.
- 비용 효율적 패턴 — Fable 5를 오케스트레이터로, Sonnet 5를 작업자로 사용하여 성능은 유지하고 비용을 절반 이하로 절감함.
- Claude Code 활용 — Subagent 설정, effort 조정, CLAUDE.md 정책을 통해 모델별 역할을 최적화함.
- pilotfish 도구 — 6가지 역할을 포함한 자동화 패키지를 통해 효율적인 에이전트 워크플로우를 즉시 적용 가능함.
- 주의 사항 — API 벤치마크와 실제 구독 환경의 차이를 인지하고, Explore 서브에이전트의 모델 상속 문제를 해결해야 함.
어제 올라온 ClaudeDevs 스레드에서 멀티 모델 패턴 두 가지에 대한 공식 수치를 공개했더라 (문서):
- 오케스트레이터로 Fable 5, 워커로 Sonnet 5 사용: Fable 단독 성능의 96%를 내면서 비용은 46% 수준 (BrowseComp 기준: 정확도 86.8% vs 90.8%, 문제당 비용 $18.53 vs $40.56)
- 실행기로 Sonnet 5, Fable 5 어드바이저에게 자문: (SWE-bench Pro 기준) 성능 약 92%, 비용 약 63%
오케스트레이터 분리 방식이 양쪽 다 이겼음. 걔네 글은 API랑 Managed Agents 쪽 위주로 설명하는데, Claude Code 구독자라면 지금 당장 똑같은 방식을 기본 기능으로 쓸 수 있어서 공유 좀 하려고.
핵심 메커니즘은 내장된 기능 세 가지임:
- Subagent
model:frontmatter.~/.claude/agents/에 있는 파일에model: haiku나model: sonnet을 적어두면 메인 세션 모델이 뭐든 간에 해당 역할은 싼 모델로 고정됨. - 에이전트별
effort:. Anthropic의 Fable 가이드 보면 요즘 모델들은effort: low로 돌려도 이전 세대xhigh급 성능이 나온다더라. 그러니까 정찰이나 단순 작업은effort: low로 돌리면 품질 저하 거의 없이 공짜나 다름없음. - 메인 세션한테 뭘 위임할지 알려주는 CLAUDE.md 정책. 이건 역할 이름으로만 소통하니까 모델이 바뀌어도 설정이 깨질 일이 없음.
아무것도 안 만들더라도 이건 꼭 알아둬야 함: v2.1.198부터 내장 Explore 서브 에이전트가 메인 세션 모델을 그대로 상속받거든. 그러니까 평소에 Fable이나 Opus를 메인으로 쓰면 백그라운드 검색할 때도 Opus 요금으로 찍힘. model: haiku로 설정된 Explore라는 이름의 사용자 에이전트를 만들어서 덮어씌워야 함.
그래서 이걸 pilotfish라는 걸로 묶어봤음 (역할 6개: Haiku 정찰병, Sonnet 기계적 실행기, Opus 판단 실행기, 적대적 신선한 컨텍스트 검증기, 그리고 Fable 쓰면 보안 분류기가 멀쩡한 보안 작업도 오작동 일으켜서 Fable은 배제한 보안 역할). 복붙 한 번이면 설치되고, 뭐 건드리기 전에 전체 계획부터 보여줌. 삭제도 되돌릴 수 있는 3단계면 끝남: https://github.com/Nanako0129/pilotfish
솔직하게 말하자면: 공식 수치는 API 벤치마크 기준이라 구독 모델에서는 비용 절감 폭이 방향성은 같아도 똑같지는 않을 거임. 설정 귀찮고 그냥 싼 세션 쓰고 싶으면 내장된 /model opusplan만 써도 대부분 해결됨. 그리고 curl | sh처럼 프롬프트 복붙해서 설치하는 건 항상 조심하고: README에 태그 고정 버전도 있으니까 어떤 파일부터 읽어야 하는지 꼭 확인해.
공개: Claude Code로 직접 조사하고 대부분 만들었음. 그 뒤에 레드팀 테스트랑 E2E 테스트 다 돌려봄. 할당량 메커니즘(결제 한도에서의 폴백 동작, 주간 2개 버킷 제한, 노력 등급 등)에 대한 더 자세한 내용은 내가 참고해라.
