Fable 5 vs 5.1 비교: 22,022번의 API 호출 분석 결과, 프롬프트당 토큰은 31% 증가했지만 비용은 31% 저렴함
Fable 5 vs Fable 5.1 across 22,022 of my own API calls: same per call, 31% more tokens per prompt, 31% cheaper per prompt
핵심 요약
Fable 5.1은 캐시 읽기 할인으로 비용은 낮아졌으나, 토큰 소모량이 많아 주간 사용량 제한에 더 빨리 도달하는 문제를 분석함.
- 성능 분석 — 22,022건의 API 호출 데이터를 통해 Fable 5와 5.1의 비용 및 토큰 효율을 비교함.
- 비용 효율성 — 캐시 읽기 할인 덕분에 프롬프트당 비용은 31% 저렴해짐.
- 사용량 문제 — 토큰 사용량이 31% 증가하면서 주간 사용량 제한에 더 빨리 도달하는 현상이 발생함.
- 대응 전략 — 모델이 도구 호출을 일괄 처리하도록 프롬프트 엔지니어링을 적용함.
요즘 들어 주간 사용량 한도가 평소보다 훨씬 빨리 차는 느낌인데, 왜 그런지 도통 감이 안 잡히더라고. 그래서 API 호출 단위가 아니라 프롬프트 단위로 토큰 비용을 측정해 봤거든. 그랬더니 내 데이터셋 기준으로 Fable 5보다 프롬프트당 토큰을 약 31% 더 많이 쓰고 있었음.
그 직후에 API 정가 기준으로 똑같은 프롬프트들 가격을 매겨봤는데, 상황이 완전히 달라지더라. Fable 5는 프롬프트당 평균 $1.52인데, 5.1은 평균 $1.05거든. 왜냐면 추가 토큰 대부분이 캐시 읽기(cache reads)인데, 5.1은 캐시 읽기 토큰 가격을 Fable 5 대비 25% 수준으로 책정했기 때문임. 그러니까 프롬프트당 토큰을 31% 더 써도, 결과적으로는 프롬프트 하나당 비용이 31% 더 저렴한 거지.
근데 주간 한도 게이지는 눈에 띄게 빨리 차오르고 있단 말이지. 내가 트랜스크립트만 보고는 직접 측정할 수 없는 이유가 딱 세 가지 정도 떠오르는데, 모델이 말을 길게 하는 거랑은 상관없는 것 같음:
-
요금제 한도 계산 방식이 Fable 5.1의 캐시 읽기 할인분을 제대로 반영하지 못하고 있을 가능성
-
5시간 윈도우 기준이 주간의 1/6에서 1/5로 바뀌었을 가능성
-
5.1 버전에서는 '노력(Effort)'이 다르게 작용할 가능성
모델이 프롬프트마다 컨텍스트를 더 많이 끌어다 쓰는 경향이 있거든. 그래서 앞으로는 모델이 어떤 컨텍스트를 수집하게 할지, 또 어떤 건 피하게 할지 내 프롬프트 자체에 가드레일을 더 촘촘하게 세우는 게 맞는 방향인 듯함.
공식 'Prompting Claude Fable 5.1' 가이드에서도 5.1은 툴 호출을 한 번에 묶어서 안 하고 턴당 하나씩만 하는 경향이 있다고 경고하더라고. 그래서 제안된 해결책이 프롬프트에 이런 문구를 살짝 추가하는 거임:
First privately list what you need next; then request every item that doesn't depend on another's result in this one response.
방금 내 CLAUDE.md에 추가했음. 이게 효과가 있을지는 데이터를 좀 더 모아봐야 알겠지.
내 수치들은 내가 쓰는 모든 기기에서 Claude Code 세션을 긁어모으는 아카이브인 'pond'에서 가져온 거임. 21일 동안 22,022번의 API 호출을 분석한 결과야. 혹시 본인 jsonl 트랜스크립트로 직접 분석해보고 싶은 사람 있으면 쿼리 공유해 줄 테니까 댓글 달아줘.



