2026년 6월 AI Gateway 프로덕션 인덱스 기준, 저비용 모델이 프로덕션 환경에 본격 투입되면서 DeepSeek의 토큰 점유율이 17%까지 급등했다. 반면 Anthropic은 전체 지출의 65%를 차지하며 비용 측면에서의 우위를 이어갔다.
매달 AI Gateway는 프로덕션 애플리케이션과 AI 연구소 사이에서 수십조 개의 토큰을 라우팅한다. 리더보드나 벤치마크와 별개로, 실제 AI 사용 현황을 들여다볼 수 있는 창구가 바로 여기다. 이 데이터는 AI Gateway 프로덕션 인덱스로 매달 공개된다.
AI Gateway 전체 토큰은 전월 대비 +20%, 전체 지출은 +43% 증가했다. 고객들이 토큰당 지불한 평균 비용은 4월보다 약 20% 높아졌다.
DeepSeek의 토큰 점유율은 단 한 달 만에 1% 미만에서 17%로 급등했지만, 지출 점유율은 여전히 1% 수준에 머물렀다.
5월 Anthropic의 지출 점유율은 61%에서 65%로 상승했으며, AI 앱 생성·백오피스 에이전트·코딩 에이전트 등 고위험 유즈케이스 전반에서 70~80%의 지출 점유율을 유지했다.
비용 효율에 대한 관심이 높아지면서 저비용 모델과 프론티어 모델 간의 라우팅도 정교해졌다. 어떤 작업에 어떤 모델을 쓸지 팀 차원에서 더 신중하게 결정하는 흐름이 자리잡는 가운데, 전체 사용량은 계속 늘었다.
지난달에는 토큰 예산 초과 문제가 기술 미디어의 주요 화두였다. Uber는 1분기 직후 연간 Claude Code 예산을 소진했고, Amazon은 비생산적인 tokenmaxxing을 억제하기 위해 KiroRank를 중단했다. 비용 급증이 현실적인 문제인 것은 분명하지만, 이번 달 데이터를 보면 프로덕션 유즈케이스에 대한 지출은 여전히 증가세를 이어가고 있다.
5월 AI Gateway 데이터에서 두 가지 주목할 만한 흐름이 포착됐다.
저비용 모델의 프로덕션 진입: 새로운 모델들이 기존 대형 연구소의 가격을 더욱 부각시키는 수준의 낮은 가격으로 출시됐고, 품질도 프로덕션 환경에 투입하기에 충분한 수준에 도달했다.
지출은 늘되, 모델 조합은 더 영리하게: 팀들은 여전히 토큰 예산을 늘리고 있지만, 그와 동시에 비용 대비 효과를 극대화하기 위한 정교한 라우팅 전략을 도입하고 있다.
2월부터 4월까지 AI Gateway에서 각 연구소의 볼륨 분포는 완만하게 변하는 데 그쳤다. 그런데 5월, DeepSeek V4 출시를 계기로 토큰 점유율 판도가 완전히 바뀌었다. 4월만 해도 거의 존재감이 없던 저비용 시장 영역이 불과 한 달 만에 AI Gateway에서 볼륨 기준 세 번째로 큰 공급자로 올라섰고, 전체 지출에는 별다른 영향을 주지 않았다.
4월에 DeepSeek는 AI Gateway 전체 토큰의 1% 미만, 지출의 0.2% 미만을 차지했다. 5월에는 볼륨 점유율이 17%로 뛰어오르며 OpenAI를 제치고 3위에 올랐다. 이 볼륨 대부분은 5월에 출시된 두 모델, deepseek/deepseek-v4-flash과 deepseek/deepseek-v4-pro에서 나왔다.
지출 구조를 보면 이야기의 나머지 절반이 드러난다. DeepSeek의 토큰 점유율이 한 달 만에 17%까지 치솟았음에도, 비용 점유율은 1% 수준에서 거의 변하지 않았다.
DeepSeek V4 Flash는 입력 $0.14 / 출력 $0.28(100만 토큰 기준)로 출시됐다. 이는 비슷한 Anthropic 모델 대비 약 20~50배 낮은 가격이며, Qwen 3.6 Plus, Kimi K2.6 등 다른 가성비 플래그십 모델과 비교해도 8~12배 저렴하다. 이 압도적인 가격 차이 덕분에 팀들은 V4 Flash를 빠르게 도입했다.
한 달 만에 이처럼 큰 폭의 볼륨 증가는 가격만으로는 설명되지 않는다. 팀들이 기존 평가 기준에 DeepSeek V4를 테스트해 본 결과, 단순히 시도해볼 만한 수준이 아니라 실제 프로덕션에 배포할 수 있는 품질이라는 결론을 내린 것이다.
AI Gateway에는 가성비 모델이 항상 있었지만, 이 정도 규모로 토큰 점유율을 차지한 건 이번이 처음이다. DeepSeek V4가 그 가격대에서 프로덕션 작업의 품질 기준을 처음으로 충족한 모델임을 보여준다.
볼륨 증가 속도는 저비용 영역이 가장 빨랐지만, 달러 기준 증가는 고가 영역이 더 빨랐다.
Anthropic의 토큰 점유율은 26%에서 32%로, 지출 점유율은 61%에서 65%로 늘었다. OpenAI의 토큰 점유율은 13% 수준을 유지했지만, 전체 규모가 커진 상황에서 지출 점유율이 12%에서 13%로 상승했다. 즉, 5월에는 OpenAI 토큰당 지불 비용이 더 높아졌다는 의미다.
DeepSeek가 평균을 끌어내렸음에도, 5월에는 토큰당 평균 비용이 올랐다. 프론티어 모델을 필요로 하는 작업이 그렇지 않은 작업보다 빠르게 증가했기 때문이다. AI 코딩 에이전트 유즈케이스에서 저비용/프론티어 모델 간의 분화가 가장 뚜렷하게 나타난다.
DeepSeek는 해당 세그먼트 토큰 볼륨의 49%를 담당했지만, 비용 기여도는 4%에 불과했다.
Anthropic은 토큰의 28%를 처리하면서 비용의 70%를 차지했다.
저비용 모델이 프로덕션 워크플로우에서 의미 있는 비중을 차지하게 됐지만, 프론티어 모델 사용량도 계속 늘고 있으며 이것이 전체 지출 증가를 이끌고 있다.
프론티어 모델의 토큰당 비용은 오르고 있지만, 고객들은 기꺼이 지갑을 열고 있다. Anthropic은 5월 전체 게이트웨이 지출의 65%를 가져갔으며, 고위험 유즈케이스 전반에서는 70~80%의 지출 점유율을 기록했다.
전체 지출이 늘었다는 것은 5월에도 AI 수요가 계속 성장했음을 보여준다. 하지만 팀들은 라우팅을 통해 예산을 더 정밀하게 운용하기 시작했다. 비용이 낮고 처리량이 많은 작업은 저가 모델에, 품질이 중요한 작업은 프론티어 모델에 배분하는 방식이다. Google의 최신 Flash 모델 도입이 더딘 것도 이 흐름을 잘 보여주는 사례다.
Gemini 3.5 Flash는 5월에 Gemini 3.0 Flash보다 높은 가격으로 출시됐지만, 대규모 마이그레이션은 일어나지 않았다. 월말 기준으로 Flash 계열 내 토큰 점유율은 3.5가 7%, 3.0이 90%였다.
2~3월에 걸쳐 Gemini 3.1 Pro가 빠르게 확산됐던 것과 비교하면, 3.5 Flash로의 마이그레이션이 느린 것은 3.0 Flash에 만족하는 팀들이 아직 추가 비용을 부담할 의향이 없다는 뜻이다.
이번 달 데이터는 전체 지출과 토큰 볼륨이 증가하는 가운데서도 시장의 가격 민감도가 높아지고 있음을 보여준다. 개발자들이 비용 대비 효과를 극대화할 방법을 적극적으로 모색하고 있다는 의미다.
데이터에서 두 가지 최적화 전략이 확인됐다.
리스크가 낮고 처리량이 많은 작업에는 저렴하면서도 충분한 성능을 갖춘 DeepSeek V4 계열 활용
ROI가 납득되기 전까지 모델 계열 업그레이드를 의도적으로 보류
라우팅을 통해 팀들은 연구소들이 프로덕션 AI 워크로드의 각 계층을 두고 경쟁하는 상황 속에서 모델 조합과 예산을 실시간으로 조정할 수 있게 됐다.
B2B 애플리케이션은 호출 횟수는 적지만 건당 비용이 높고, B2C 애플리케이션은 저비용 호출이 대량으로 발생한다. 5월 기준 토큰당 비용은 B2B가 B2C보다 약 60% 높았다.
전체 요청의 약 4분의 1 미만이 툴 호출로 끝나지만, 해당 요청이 소비하는 토큰은 전체의 절반을 훌쩍 넘는다. 두 지표 모두 전월과 비교해 큰 변화는 없다.
요청 수가 많은 앱일수록 프로덕션에서 더 많은 모델을 운용한다. 볼륨이 가장 낮은 구간에서는 단일 모델 구성이 지배적인 반면, 월 100만 건 이상의 요청을 처리하는 앱 대부분은 11개 이상의 모델에 라우팅한다.
유즈케이스의 비용 점유율은 소비 토큰 수가 아니라, 오답의 비용이 얼마나 큰지를 나타낸다. 개인 비서와 코딩 에이전트는 토큰당 비용이 낮지만, 백오피스 업무나 채용 관련 작업은 비용이 훨씬 높다.
2026년 4월 AI Gateway 프로덕션 인덱스도 확인해보세요.
이 분석은 2026년 5월까지의 Vercel AI Gateway 익명화 집계 라우팅 데이터를 기반으로 한다.
측정 방식에 대한 참고 사항은 다음과 같다.
지출(Spend) 은 자체 API 키를 사용하는 팀 간 비교를 표준화하기 위해 시장 요율(공시 정가)을 적용한다.
볼륨(Volume) 은 AI Gateway를 통해 라우팅된 토큰 수를 기준으로 한다.
B2C, B2B, 유즈케이스 분류 는 집계 데이터 기준이며, 개별 팀이나 워크로드는 식별되지 않는다.