일주일 사용 후기: Opus 4.7 vs 4.6 - 낮은 성공률과 두 배 늘어난 재시도
one week in: opus 4.7 vs 4.6 - worse one shot rate, double the retries
핵심 요약
사용자 데이터 분석 결과, Opus 4.7이 4.6보다 성공률은 낮고 비용과 재시도 횟수는 증가함.
- 성능 저하 — 4.7 버전의 원샷 성공률이 4.6 대비 하락함.
- 비용 증가 — 토큰 출력량이 늘어나면서 호출당 비용이 상승함.
- 재시도 증가 — 코드 수정 시 재시도 횟수가 약 두 배로 늘어남.
- 도구 활용 — 서브 에이전트 위임 및 도구 사용 빈도가 감소함.
며칠 전 제 사용 데이터를 활용해 Opus 4.6과 4.7을 비교해 보았습니다. 두 모델이 실제로 어떻게 다르게 작동하는지 확인하기 위해서였죠.
https://github.com/getagentseal/codeburn
4.7을 사용하기엔 아직 이른 감이 있지만, 몇 가지 놀라운 점이 있었습니다.
제 세션에서 4.7은 4.6보다 첫 시도에 성공하는 경우가 적었습니다. 원샷 성공률은 74.5% 대 83.8%였고, 편집당 재시도 횟수는 약 두 배(0.46 대 0.22)로 늘어났습니다.
또한 호출당 출력량이 훨씬 많아졌습니다(4.6의 372토큰 대비 약 800토큰). 이로 인해 비용이 눈에 띄게 비싸졌습니다. 호출당 비용은 $0.185 대 $0.112입니다.
작업 유형별로 분석해 보니 코딩과 디버깅 모두 4.7에서 더 약한 모습을 보였습니다. 코딩 원샷 성공률은 84.7%에서 75.4%로, 디버깅은 85.3%에서 76.5%로 떨어졌습니다. 기능 구현 작업은 4.7이 약간 더 나았지만(75% 대 71.4%), 표본이 작습니다. 위임 작업은 큰 차이를 보였으나(100% 대 33.3%), 4.7 쪽 데이터가 3개뿐이라 아직 큰 의미를 두긴 어렵습니다.
4.7은 턴당 도구 사용 빈도가 낮고(1.83 대 2.77), 서브 에이전트 위임도 거의 하지 않습니다(0.6% 대 3.1%). 이것이 모델의 스타일 차이인지, 아니면 단순히 표본이 적어서인지 아직 확실하지 않습니다.
몇 가지 주의할 점은, 이 데이터는 4.7의 3일치 데이터(3,592회 호출)와 4.6의 8일치 데이터(8,020회 호출)를 비교한 것입니다. 일부 카테고리는 표본이 적습니다. 이 수치는 사용량이 늘어남에 따라 변할 것이며, 여러분이 어떤 작업을 하느냐에 따라 결과는 다를 수 있습니다.
(두 모델 모두 Effort level은 Max로 설정했습니다)
지표 설명:
지표 - 측정 항목
One-shot rate - 재시도 없이 성공한 편집 턴의 비율
Retry rate - 편집 턴당 평균 재시도 횟수 (낮을수록 좋음)
Self-correction - 모델이 스스로 실수를 잡아낸 턴의 비율
Cost / call - API 호출당 평균 비용
Cost / edit - 편집 턴당 평균 비용
Output tok / call - 호출당 모델의 출력량
Cache hit rate - 캐시에서 가져온 입력값과 새로운 컨텍스트의 비율
(두 모델 모두 Effort level은 Max로 설정)
직접 확인해 보세요. 사용 데이터에 따라 결과는 다를 수 있습니다.
npx codeburn compare

