모델 표시 가격은 78% 저렴해도 실제 실행 비용은 22% 더 비쌀 수 있다. 단위 가격은 당신의 청구서가 아니다.
A model listed 78% cheaper cost 22% more to actually run. Unit price isn't your bill.
핵심 요약
LLM의 토큰당 가격보다 실제 작업 시 소모되는 토큰량과 가변적인 비용 구조를 파악하는 것이 중요하다는 연구 결과.
- 실제 비용 분석 — 모델별 토큰 소모량이 달라 표시 가격보다 실제 비용이 훨씬 높을 수 있음
- 생각 토큰 문제 — 모델이 '생각'에 사용하는 토큰이 전체 비용의 80% 이상을 차지함
- 가변적 비용 — 동일한 쿼리라도 실행할 때마다 비용이 최대 9.7배까지 차이 날 수 있음
- 비즈니스 영향 — LLM 기반 서비스 운영 시 고정 요금제는 마진을 잠식할 위험이 있음
Microsoft Research, Stanford, Berkeley, CMU에서 발표한 새로운 연구에 따르면, 8개의 최첨단 추론 모델을 9개의 작업 도메인에서 실행하여 표시된 토큰당 가격과 실제 작업 완료 비용을 비교했습니다. 5번의 일대일 대결 중 1번 이상은 표시 가격이 더 낮은 모델이 실제로는 더 비싼 비용이 발생했습니다. 최악의 경우 28배까지 차이가 났습니다.
대표적인 예로, Gemini 3 Flash는 GPT-5.2보다 표시 가격이 78% 저렴하지만, 모든 작업을 통틀어 실제 실행 비용은 22% 더 높았습니다.
이런 결과가 나오는 이유는 가격 페이지에서 모델을 고를 때 놓치기 쉽습니다. 질문당 비용을 내는 게 아니라 토큰당 비용을 내는데, 모델마다 같은 질문에 답하기 위해 소모하는 토큰 양이 천차만별이기 때문입니다. 같은 쿼리에서 한 모델은 다른 모델보다 900% 더 많은 '생각 토큰'을 사용했습니다. 생각 토큰이 전체 출력 비용의 80% 이상을 차지했습니다. 토큰당 가격은 싸지만 작업당 비용은 더 비싼 셈입니다.
COGS(매출원가)에 대한 제 생각을 바꾼 부분은 비용이 일정하지 않다는 점입니다. 같은 쿼리, 같은 모델이라도 실행할 때마다 비용이 최대 9.7배까지 널뛰었습니다. 즉, 실제 비용은 정가 곱하기 소비량인데, 이 소비량은 가변적이고 모델마다 다르며 부분적으로는 무작위입니다.
LLM을 기반으로 서비스를 구축한다면 두 가지 사실을 명심해야 합니다. COGS는 정가가 아닙니다. 그리고 사용량에 고정 수수료를 부과한다면, 가장 많이 사용하는 사용자는 조용히 적자가 되고 당신의 마진은 당신이 통제할 수 없는 숫자에 좌우되게 됩니다.
표시 가격은 마케팅용 숫자입니다. 청구서는 행동에 따른 숫자입니다. 결정하기 전에 둘 다 측정하세요.


