2026년 7월 데이터를 기반으로 한 AI 게이트웨이 프로덕션 지수 분석 결과, DeepSeek가 토큰 사용량 기준 2위 기업으로 올라섰다. Anthropic은 전체 지출액의 65%를 점유했으며, 토큰당 평균 가격은 다른 기업의 두 배를 웃돌았다.
AI 게이트웨이 프로덕션 지수 — 2026년 8월
AI 게이트웨이는 매월 수십조 개의 토큰을 프로덕션 애플리케이션과 AI 랩 사이에서 처리합니다. 이 트래픽 데이터를 통해 오늘날 기업 환경에서 AI가 실제로 어떻게 활용되는지 파악할 수 있으며, 매월 이곳에 공개합니다. 5월, 6월, 7월 프로덕션 지수 리포트도 확인하세요.
8월 지수는 2026년 7월까지 수집된 AI 게이트웨이 데이터를 기반으로 합니다.
7월 토큰당 평균 가격은 13.6% 하락했다. 5월에 약 20% 상승하고 6월에는 보합세를 유지했던 것과 대조적이다. 토큰 소비량이 워낙 빠르게 늘어난 탓에, 지출액이 37% 증가했음에도 토큰당 비용은 두 자릿수 하락폭을 기록했다.
DeepSeek는 토큰 사용량 기준 2위 랩으로 올라섰으며, 현재 Google의 두 배가 넘는 사용량을 처리하고 있다.
Anthropic은 전체 토큰 사용량의 30%를 처리하면서도 게이트웨이 지출액의 65%를 점유했으며, 토큰당 가격은 다른 랩 평균의 4.4배에 달했다.
이미지와 동영상 양쪽에서 선두가 바뀌었다. 이미지 사용량에서는 Google의 Nano Banana가 OpenAI의 GPT Image를 앞질렀고, 동영상에서는 ByteDance의 Seedance가 사용량과 지출액 모두 1위를 차지했다.
Moonshot은 7월 16일 Kimi K3를 출시했다. 6월에 공개된 Z.ai의 GLM 5.2처럼 장기 에이전트 작업에 최적화된 모델로, 출시 초기부터 전작인 K2.5보다 요청당 토큰 수가 약 12배에 달하는 무거운 사용 패턴을 보였다.
성장 속도도 빨랐다. K3의 일일 사용량은 출시 첫 주부터 7월 마지막 주 사이에 세 배로 늘었고, 월말에는 요청당 토큰 수가 Claude Opus 4.8 수준에 도달했다. 7월의 마지막 완전한 하루를 기준으로, K3는 게이트웨이 전체에서 토큰 사용량 8위를 기록했다.
이 수요는 기존 사용자가 이동한 게 아니라 새롭게 유입된 것이었다. K3는 출시 2주 만에 전체 Kimi 토큰의 약 3분의 2를 처리했고, 마지막 주에는 82%까지 점유율이 높아졌다. 반면 다른 Kimi 모델의 사용량은 소폭 감소에 그쳤다.
7월 게이트웨이 지출액에서 오픈 웨이트 모델의 비중은 8.6%로 두 배 이상 늘었다. 이 증가분의 90% 이상이 Moonshot과 Z.ai에서 나왔다. Moonshot의 게이트웨이 전체 지출 비중은 4배로 뛰어 2.3%를 기록했다. 저가 오픈 웨이트 모델들은 수개월에 걸쳐 사용량은 늘려왔지만 매출로는 이어지지 않았다. Kimi K3와 GLM 5.2는 DeepSeek의 토큰당 요금보다 11배 이상 높은 가격대에서 의미 있는 사용량을 확보한 최초의 오픈 웨이트 모델이다.
6월 리포트에서는 DeepSeek가 토큰 사용량 경쟁에 본격적으로 뛰어들었다고 언급했고, 지난달에는 오픈 웨이트 랩이 곧 사용량 기준 2위에 오를 것이라고 전망했다. 그 예측이 7월에 현실이 됐다. DeepSeek가 Google을 제치고 2위 자리를 차지한 것이다.
4월에는 Google이 게이트웨이 전체 토큰 사용량의 약 40%를 담당한 반면, DeepSeek는 1%에도 미치지 못했다. 하지만 7월에는 DeepSeek의 점유율이 25%로 올라서며 Google(11%)의 두 배를 넘어섰다. DeepSeek의 최저가 모델인 V4 Flash 하나만으로도 Google 전체 모델의 토큰 사용량을 웃돌았다.
이 역전은 주로 소비자 대상 서비스에서 일어났다. Google의 개인 어시스턴트 토큰 점유율은 한 달 만에 절반 이상 줄었고, DeepSeek의 점유율은 세 배 이상 늘었다. Google이 잃은 토큰 점유율 대부분이 DeepSeek로 넘어간 셈이다. 7월 게이트웨이에서 가장 많은 토큰을 처리한 모델은 DeepSeek V4 Flash로, 전체의 약 5분의 1을 차지했으며 2위 모델보다 70% 더 많은 토큰을 소화했다.
오픈 웨이트 모델은 그동안 저가 시장을 장악해왔다. 4월부터 6월 사이 게이트웨이 토큰 사용량 점유율은 11%에서 29%로 거의 세 배 늘었지만, 지출 점유율은 게이트웨이 전체 지출의 4센트 미만에 머물렀다.
7월에도 사용량 점유율은 성장세를 이어가 36%까지 올랐다. 그런데 지출 점유율은 이전 흐름과 달리 두 배 이상 늘어 달러당 약 9센트에 육박했으며, 이는 지수 사상 최고치다.
7개월 동안 93% 아래로 내려간 적 없던 4대 프론티어 랩의 토큰 지출 합산 점유율이 89%로 떨어졌다. 하락분 대부분은 Google에서 나왔다. 그런데 Google이 잃은 지출액은 DeepSeek로 거의 흘러가지 않았으며, DeepSeek의 지출 점유율은 사용량이 늘었음에도 거의 변동이 없었다. 오픈 웨이트 지출 증가분은 전적으로 Z.ai와 Moonshot의 신규 모델이 끌어낸 것이다.
기업들은 먼저 작업 요건에 맞는 모델 등급을 정한 뒤, 그 안에서 가격을 보고 선택한다. DeepSeek와 Opus는 애초에 같은 시장에서 경쟁한 적이 없다. 최근 두 달 사이 출시된 GLM 5.2와 Kimi K3는 클로즈드 웨이트 랩이 독점해온 워크로드에서 의미 있는 점유율을 확보한 최초의 오픈 웨이트 모델이다.
7월에는 기업들이 추론 처리를 더 많이 구매하면서도 저가 모델을 더 많이 활용했다. 사용량은 59% 증가했고 지출액은 37% 늘었지만, 토큰당 평균 가격은 13.6% 낮아졌다.
6월의 모델 구성을 그대로 유지했다면 평균 가격은 하락이 아니라 거의 보합세를 보였을 것이다. OpenAI가 대표적인 사례다. OpenAI 토큰의 평균 비용이 6월 수준의 58%로 떨어진 것은, 새로 증가한 사용량의 85%가 GPT-5 패밀리 중 가장 저렴한 GPT-5-Nano에 집중됐기 때문이다.
평균 가격 하락은 전적으로 기업들의 라우팅 선택에서 비롯됐다. 두 달 모두 1000만 토큰 이상을 사용한 수천 개 팀 중 4분의 3이 모델 구성의 10분의 1 이상을 바꿨고, 5분의 3은 4분의 1 이상을 변경했다.
중간값 기준으로 팀의 토큰당 비용은 2.9% 하락했지만, 시작점에서 5% 이내로 유지한 팀은 6개 중 1개에 불과했다.
전체의 4분의 1은 비용을 30% 이상 절감했는데, 대체로 월 초 기준 게이트웨이 평균보다 훨씬 높은 단가를 지불하던 팀들이었다. 반면 또 다른 4분의 1은 비용이 20% 이상 올랐으며, 이들은 대부분 이전에 평균 이하 단가를 사용하던 팀들이었다. 전반적으로 고가 구간은 내려오고 저가 구간은 올라가는 흐름이 동시에 나타났다.
7월 토큰의 81%는 6개월 전에는 게이트웨이에 없던 모델에서 처리됐다. 오픈 웨이트 모델의 사용량 점유율은 전체의 3분의 1을 넘어섰으며, 토큰당 단가는 프론티어 모델의 약 7분의 1 수준이다. Google의 게이트웨이 토큰 사용량 점유율은 24.0%에서 10.7%로 급락했다. Anthropic은 2포인트 빠진 29.8%, OpenAI는 12.8%로 올랐다.
5월 이후 게이트웨이 지출액은 74% 늘었고 사용량은 두 배로 증가했다. 7월 토큰 증가 속도는 6월의 거의 두 배에 달했다. 달러당 구매할 수 있는 토큰 수가 매달 늘어나는 상황에서도 추론 지출은 계속 증가하고 있다.
오픈 웨이트 모델의 사용량 점유율이 세 배로 늘어나는 동안에도 Anthropic은 매달 게이트웨이 지출액의 60% 이상을 유지해왔다. 7월에는 전체 사용량의 30%를 처리하면서 전체 지출액의 65.1%를 차지했다.
Anthropic 토큰의 평균 가격은 다른 랩 전체 평균의 4.4배로, 6월의 3.4배에서 더 벌어졌다. 이 격차가 확대된 데는 Claude Fable 5의 영향이 컸다. 3주간의 수출 통제 적용으로 서비스가 중단됐다가 7월 1일 복귀한 Fable 5는 빠르게 게이트웨이 전체 지출의 13.2%를 차지하며 Opus 4.8에 이어 2위에 올랐다. 게이트웨이에서 토큰 사용량 기준 가장 큰 사용 사례인 코딩 에이전트 분야에서 Anthropic은 지출의 80% 이상을 가져갔다.
Anthropic에는 저가 시장을 겨냥한 모델이 없다. 가장 저렴한 Haiku 4.5조차 게이트웨이 평균 토큰당 가격의 3분의 2를 조금 넘는 수준이다. OpenAI의 GPT-5-Nano는 그 6분의 1, DeepSeek의 V4 Flash는 16분의 1에 불과하다.
OpenAI나 Google 비용을 줄이려는 고객은 같은 공급사 내의 저가 모델로 이동할 수 있다. 하지만 Anthropic 비용을 줄이려면 Anthropic을 떠나는 수밖에 없다. 그럼에도 7월에 Anthropic은 여전히 전체 지출의 과반을 차지했다. Anthropic의 프리미엄은 저가 모델이 처리할 수 있는 것과 고객이 실제로 필요로 하는 것 사이의 격차에서 비롯된다.
AI 게이트웨이에서 모델을 바꾸는 것은 코드 한 줄만 수정하면 되기 때문에, 특정 모델에 묶이는 구조가 아니다. Fable 5가 복귀했을 때 일일 사용량은 이전 수준으로 거의 정확히 회복됐지만, 7월에 이를 사용한 팀의 10곳 중 9곳은 이전에 한 번도 사용한 적 없는 팀이었다. 작업은 돌아왔지만, 고객은 달라져 있었다.
나머지 시장의 토큰 평균 가격은 Anthropic의 4분의 1에도 못 미쳤지만, Anthropic은 여전히 게이트웨이에서 지출되는 3달러 중 2달러를 가져갔다. 가격 경쟁은 분명히 벌어지고 있다. 다만 그 경쟁이 가장 치열한 곳은 돈이 가장 적게 몰리는 시장이다.
6월에는 OpenAI의 GPT Image가 게이트웨이에서 생성된 이미지의 대부분을 담당했다. 7월에는 Google의 Nano Banana가 45%로 GPT Image(42%)를 앞질러 1위에 올랐으며, 지출액은 양쪽이 거의 비슷하게 나뉘었다. Nano Banana의 점유율 상승은 거의 Gemini 3.1 Flash Lite Image 한 모델에서 비롯됐다. 아이러니하게도 Google은 토큰 사용량 순위가 4위로 내려간 같은 달 이미지 1위를 차지했다.
동영상 분야에서는 ByteDance의 Seedance가 생성 건수와 지출액 양쪽에서 모두 1위를 차지했다. 6월 사용량 1위였던 xAI의 Grok Imagine은 2위로 내려앉았다. 동영상에 지출된 비용의 약 70%는 중국 랩이 가져갔다.
게이트웨이에서 토큰 기준 가장 큰 워크로드인 코딩 분야에서 DeepSeek는 사용량의 약 3분의 1을 담당했지만, 지출액의 5분의 4 이상은 Anthropic이 가져갔다.
백오피스 에이전트는 여전히 토큰당 비용이 가장 높은 작업으로, 지출 점유율이 사용량 점유율의 약 2.5배에 달한다.
이 분석은 2026년 7월까지의 Vercel AI 게이트웨이 익명 집계 라우팅 데이터를 기반으로 합니다.
측정 방식에 대한 참고 사항:
사용량(Volume) 은 AI 게이트웨이를 통해 처리된 모든 토큰을 집계합니다.
지출액(Spend)은 각 요청을 해당 랩의 공시 가격 기준으로 산정합니다.
토큰당 가격(Price per token)은 총 지출액을 총 사용량으로 나눈 값입니다.
오픈 웨이트(Open-weight) 사용량 및 지출 점유율은 자체 모델을 대규모로 서비스하는 4개 오픈 웨이트 랩(DeepSeek, MiniMax, Moonshot, Z.ai)을 기준으로 합니다.
이미지(Image)와 동영상(video) 수치는 요청 수나 토큰 수가 아닌 생성된 미디어 건수를 기준으로 합니다.
모든 수치는 최신 데이터를 기준으로 하며, 방법론 업데이트에 따라 이전 달 수치가 수정될 수 있습니다.