Claude Haiku 5.5가 같은 복셀 파고다 작업에서 GPT-6 Luna보다 12배 더 비쌈
Claude Haiku 5.5 cost 12x more than GPT-6 Luna for the same voxel pagoda
핵심 요약
Claude Haiku 5.5가 100k 컨텍스트 이후 5배의 비용이 청구되는 구조 때문에 복셀 파고다 생성 작업에서 GPT-6 Luna보다 12배나 비싼 비용이 발생한다는 분석.
- 가격 비교 — Haiku 5.5가 100k 컨텍스트 초과 시 비용이 5배로 뛰면서 Luna보다 12배 비싸짐.
- 벤치마크 의문 — 작성자의 테스트 방식과 모델 사용 여부에 대해 커뮤니티의 의구심이 제기됨.
- 토큰 효율성 — Haiku가 긴 컨텍스트 작업에서 토큰을 과도하게 소모하는 '토큰 고블린'이라는 비판.
- 사용 사례 논쟁 — 복셀 파고다 생성이 Haiku의 적절한 벤치마크인지에 대한 의견 대립.

haiku 5.5가 방금 출시돼서, 직접적인 경쟁자인 gpt-6 luna랑 비교하면 어떤지 진짜 궁금하더라고. 그래서 악명 높은 voxel pagoda 테스트를 돌려봤음. 내가 진짜 확인하고 싶었던 건 anthropic이 최소한 자기네 제일 싼 모델만큼은 토큰 잡아먹는 괴물이 아니게 만들었나 하는 거였는데(스포일러: 아니었음), 실제로 쓰기 저렴한 모델을 만들긴 했나 싶어서였지.
| model | effort | tokens in (cached) | tokens out | API-equivalent cost |
|---|---|---|---|---|
| Claude Haiku 5.5 | xhigh | 268.8M (262.7M) | 4.46M | $24.96 |
| GPT-6 Luna | xhigh | 64.5M (61.1M) | 1.18M | $1.96 |
haiku는 확실히 또 다른 토큰 고블린이 맞음. 근데 이게 왜 이렇게 비싼지 진짜 이유는 100k 컨텍스트 넘어가면 API 가격이 5배로 뛰기 때문임. 그래서 100k 토큰 넘는 요청은 전부 5배로 청구되는데, 에이전트 세션 돌리면 거의 모든 턴이 100k를 넘기거든. luna는 272k 컨텍스트에서 그런 일이 발생하는데, 기본 설정으로 쓰면 어차피 그 제한에서 자동으로 압축되니까 상관없음.
설정: 두 모델 다 atomic.chat에서 구독해서 테스트함.
