Claude Pro와 ChatGPT Plus의 실증적 비교
An Empirical Comparision of Claude Pro and ChatGPT Plus
핵심 요약
Artificial Analysis 데이터를 기반으로 Claude와 GPT 모델의 성능 및 비용 효율성을 비교 분석함.
- 성능 비교 — Opus 5가 Sol 5.6보다 지능 점수는 높지만 비용 효율성은 떨어짐
- 비용 효율성 — GPT 모델들이 토큰 소모량이 적어 전반적인 작업 비용이 더 저렴함
- 모델별 차이 — Claude 모델은 더 길게 생각하고 많이 작성하는 경향이 있음
- 토큰 효율 — Sonnet 5는 Terra보다 토큰 소모가 많아 비용 격차의 주원인이 됨
Artificial Analysis의 수치를 가져왔음. 이 주제에 관한 모든 스레드가 데이터 없이 분위기만 따지고 있어서 말이지. Opus 5가 지능 면에서 GPT-5.6 Sol을 61 대 59로 이기는데, 사실상 차이가 없는 수준임. 그런데 Sol은 작업당 비용이 절반 수준($1.23 vs $2.34)임. 미드 티어는 Anthropic에게 더 안 좋은 상황임: GPT-5.6 Terra가 55점, Sonnet 5가 53점을 기록했고, 속도는 126 tok/s 대 82 tok/s, 비용은 작업당 $0.51 대 $1.72임. 스몰 티어는 비교조차 안 됨. Luna가 51점, Haiku 4.5가 30점을 기록했는데, 컨텍스트는 5배 더 크고 비용은 4분의 1 수준임. 패턴을 보면 Claude 모델들이 더 길게 생각하고 더 많이 작성하기 때문에, OpenAI가 백만 토큰당 더 많은 비용을 청구하더라도 결과적으로는 토큰을 덜 쓰게 되어 전체 비용은 더 적게 나옴. 이건 구독 데이터가 아니라 API 데이터라는 점을 참고해야 함. 하지만 OpenAI와 Anthropic이 동일한 양의 자원을 제공한다고 가정하면, ChatGPT Plus 플랜이 약 70% 더 효율적일 것임.
수정: 토큰 효율성 차트가 이를 직접적으로 뒷받침함: Sonnet 5는 Intelligence Index 작업당 약 70k 출력 토큰을 소모하는 반면, Terra는 약 20k로 같은 작업을 수행함. 대략 3.5배 적게 쓰는 건데, 이게 사실상 전체 비용 격차의 핵심임. 스몰 티어는 토큰 면에서 격차가 덜하지만(Haiku ~24k vs Luna ~20k), Luna는 여전히 양 축 모두에서 매력적인 사분면에 위치하는 반면, Haiku는 그 밖에 머물며 더 많은 토큰을 쓰고도 점수는 21점이나 낮음.

