78% 저렴하다고 광고하는 모델이 실제로는 22% 더 비쌀 수 있음. 단가는 곧 청구 금액이 아님.
A model listed 78% cheaper cost 22% more to actually run. Unit price isn't your bill.
핵심 요약
LLM의 토큰당 단가보다 실제 작업 수행 시 소모되는 토큰량과 가변적인 비용을 고려해야 한다는 분석입니다.
- 비용 산정 오류 — 모델별로 동일 작업에 소모되는 토큰량이 달라 단가보다 실제 비용이 훨씬 높을 수 있음
- 추론 토큰 비중 — 전체 비용의 80% 이상이 사고 과정(thinking tokens)에서 발생함
- 비용 가변성 — 동일한 모델과 쿼리라도 실행 시마다 비용이 최대 9.7배까지 차이 날 수 있음
- 비즈니스 영향 — 고정 요금제 사용 시 헤비 유저의 비용이 마진을 잠식할 위험이 있음
[블록 1/6] Microsoft Research, Stanford, Berkeley, CMU에서 발표한 새로운 연구에 따르면, 8개의 최첨단 추론 모델을 9개의 작업 도메인에서 실행하여 명시된 토큰당 가격과 실제 작업 완료 비용을 비교했습니다. 5번 중 1번 이상의 일대일 대결에서, 명시된 가격이 더 낮은 모델이 실제로는 더 비싼 것으로 나타났습니다. 최악의 경우 28배까지 차이가 났습니다.
[블록 2/6] 대표적인 예로, Gemini 3 Flash는 GPT-5.2보다 78% 저렴하다고 명시되어 있지만, 모든 작업에 걸쳐 실제 실행 비용은 22% 더 높았습니다.
[블록 3/6] 가격 페이지에서 모델을 고를 때 놓치기 쉬운 이유는, 질문당 비용을 내는 게 아니라 토큰당 비용을 내기 때문입니다. 모델마다 같은 질문에 답하기 위해 소모하는 토큰량이 천차만별입니다. 같은 쿼리에서도 한 모델이 다른 모델보다 '사고 토큰(thinking tokens)'을 900% 더 많이 사용했습니다. 사고 토큰은 전체 출력 비용의 80% 이상을 차지했습니다. 토큰당 가격은 싸지만, 작업당 비용은 더 비싼 셈입니다.
[블록 4/6] COGS(매출원가)에 대한 제 생각을 바꾼 부분은 비용이 일정하지 않다는 점입니다. 같은 쿼리, 같은 모델이라도 실행할 때마다 비용이 최대 9.7배까지 변동했습니다. 즉, 실제 비용은 정가 곱하기 소비량인데, 이 소비량이 가변적이고 모델마다 다르며 부분적으로는 무작위적입니다.
[블록 5/6] LLM 기반으로 서비스를 구축한다면 두 가지 사실을 기억해야 합니다. COGS는 정가가 아닙니다. 그리고 사용량에 고정 수수료를 얹어서 청구한다면, 헤비 유저들은 조용히 적자가 되고 마진은 당신이 통제할 수 없는 숫자에 휘둘리게 됩니다.
[블록 6/6] 정가는 마케팅용 숫자일 뿐입니다. 청구 금액은 행동에 따른 숫자입니다. 결정하기 전에 둘 다 측정하세요.


