이 차트 뭔가 수상해서 직접 수정해 봤습니다 (결과 보고 충격받음!)
this chart felt shady, so I fixed it (what I found will shock you!)
핵심 요약
Anthropic의 시스템 카드 차트가 로그 스케일로 비용을 왜곡했다고 판단한 작성자가 직접 실험을 통해 Opus 4.8의 효율성을 재검증했습니다.
- 로그 스케일 비판 — 비용을 로그 스케일로 표시하는 것은 수치적 충격을 완화하려는 의도가 의심됨
- Opus 4.8 효율성 — 낮은 노력(low effort) 설정의 Opus 4.8이 Sonnet 4.6의 높은 설정보다 성능과 비용 면에서 우수함
- 데이터 투명성 요구 — Sonnet 4.6 데이터가 차트에서 누락된 점을 지적하며 비교 데이터의 필요성 강조
- 실험 방법론 공유 — 50개 작업을 샘플링하여 Docker 환경에서 테스트했으나 샘플 수 부족으로 추가 검증 필요
첫 번째 차트는 Opus 4.8 시스템 카드에 있는 거야(집에서 따라 하는 사람들은 195페이지 봐). 이거 보면서 좀 이상하다 싶은 게 몇 개 있더라고:
-
가로축이 로그 스케일인데, 뭐 쓸 만한 이유가 있긴 하겠지만 데이터 좀 만져본 입장에서 말하자면, 보통 사람들은 로그 스케일 축 보면 그냥 대충 흘려보거든. 그래서 이걸 "수치상 충격을 완화"하려고 쓰는 경우가 많아서, 딱 보면 뭔가 쎄한 느낌이 든단 말이지.
-
출력 토큰 수 따위 아무도 관심 없어. 어차피 돈 나가는 게 문제지. 그러니까 이 축은 그냥 $ 단위로 표시했어야 함.
-
비교 대상에 Sonnet 4.6이 없음. 시스템 카드에 있는 다른 차트들에는 Sonnet이 잔뜩 들어가 있는데, 왜 여기만 쏙 뺐을까?
…그래서 내가 직접 만들기로 했다.
방법은 간단해: 공개된 731개 작업 세트에서 노력 수준(effort level)별로 50개씩 무작위로 뽑아서, Docker 이미지에서 출력 패치를 채점했어. 불확실성 범위 보면 알겠지만, 제대로 된 결과 나오기도 전에 때려치웠다. 변명 좀 하자면 24시간 넘게 돌렸고, 나도 토큰이 무한정 있는 건 아니니까. 내 결론은 순서 상관없이 다음과 같음:
-
"Sonnet 4.6이 Opus 4.6보다 낫다"고 하던 애들 말이 맞았을지도 모르겠네.
-
Opus 4.8 토큰 너무 빨리 타버린다고 징징대는 애들은 노력 수준 한 단계만 낮춰봐. 로그 스케일 때문에 max 모드가 얼마나 미친 듯이 비싼지 가려져 있었던 거임.
-
low 모드의 Opus 4.8이 med, high, max 모드의 Sonnet 4.6보다 성능 좋고 가격도 싸다. Sonnet 4.6 low 모드로 충분히 해결 가능한 작업이 아니라면, 지금은 그냥 Opus 쓰는 게 이득임.
-
왜 Sonnet을 숨겼는지 딱 답 나오지? 여기서 결과가 처참하거든. 물론 다른 작업에서는 여전히 쓸만할 수도 있겠지.
물론 이건 어디까지나 특정 벤치마크 기준이고, 벤치마크라는 게 원래 좀 가짜 같은 구석이 있잖아. 그래도 난 "모든 벤치마크는 쓰레기지만, 그중 몇 개는 쓸모가 있다"는 주의라.
후속 작업: (니들 토큰 써서 결과 좀 알려줘라 ㅋㅋ)
-
표본(N) 더 필요함.
-
누가 로컬에서 Opus 설정 좀 검증해 볼 사람? 내 방법론이 Anthropic 거랑 맞는지 확인하면 좋을 듯.
-
다른 업체 가격으로 대입하면 차트가 어떻게 나올까?
-
GPT+codex 데이터 포인트도 좀 넣어보면 재밌겠는데.
/u/samthehugenerd 님이 제출함
[링크] [댓글]

