Opus 4.8은 여전히 GPT-5.5보다 못하네
Opus 4.8 still isn't as good as GPT-5.5
핵심 요약
Opus 4.8의 토큰 효율성과 성능에 대한 사용자들의 불만과 토론이 이어지고 있습니다.
- 성능 비교 — Opus 4.8이 GPT-5.5 대비 토큰 효율성이 떨어지고 결과물도 부족함
- 토큰 인플레이션 — 사용자들이 4.8 버전에서 예상보다 훨씬 많은 토큰이 소모되는 현상을 겪음
- 모델 너프 의혹 — Anthropic이 새로운 모델 출시 후 성능을 의도적으로 낮춘다는 의구심 제기
- 코드 작업 경험 — 일부 사용자는 코드 감사 등 특정 작업에서 4.8의 성능이 나쁘지 않다고 평가함
나의 일상적인 업무 흐름에서 새로운 Opus 4.8 릴리스를 GPT-5.5와 비교 테스트해보고 있어. 특히 내가 준비 중인 웹게임을 위한 고퀄리티 PvE 보스전 빌드 같은 복잡한 코딩 작업 위주로 말이야. 4.8이 4.7보다 기능적으로 업그레이드된 건 맞지만, 토큰 사용량이 엄청나게 많아.
예를 들어, 표준 프롬프트를 실행할 때 Opus 4.8은 결과물의 품질에 비해 예상보다 훨씬 많은 토큰을 소비하고 있어. 반면에 GPT-5.5는 똑같은 작업을 훨씬 더 철저하게 처리하면서도 토큰 효율성은 훨씬 높게 유지하고 있지.
보통 Anthropic이 새로운 Claude 모델을 출시하면, 일상 업무에서 덜 임팩트 있게 느껴지도록 금방 성능을 낮추는 것 같아. 그리고 사람들이 다른 최신 모델로 갈아탈 때까지 이 주기가 반복되지. 마치 최고의 모델들이 갑자기 너프를 당하는 'permaspike' 효과 같아. Anthropic이 테스트 중인 다른 모델들을 위해 연산 자원을 아끼려는 건지 말이야.
혹시 4.8에서 엄청난 토큰 인플레이션을 겪고 있는 사람 또 있어? 아니면 지금 특정 프롬프트 구조에 최적화가 덜 된 걸까?

