Opus 5.5가 '너프' 단계에 진입했나? LiveNerf 기준점 업데이트
Is Opus 5.5 entering a “nerfed” phase? LiveNerf baseline update
핵심 요약
Claude Opus 5.5의 성능 저하 여부를 과학적으로 추적하는 오픈소스 프로젝트 'LiveNerf'의 진행 상황과 커뮤니티의 성능 저하 체감 반응.
- 성능 추적 프로젝트 — SWE-bench 등 표준화된 벤치마크로 Opus 5.5의 성능 변화를 매일 측정함
- 너프 의혹 제기 — 최근 성능 저하를 체감한 사용자들이 많아지며 모델이 의도적으로 하향 조정되었는지 논란이 됨
- 데이터 수집 투명성 — AI 기업의 불투명한 운영에 대응해 사용자들이 직접 모델 성능을 검증하려는 움직임
- 부하에 따른 성능 변화 — 사용자가 몰리는 시간대에 모델 성능이 동적으로 조정될 가능성에 대한 의문 제기
며칠 전에 Claude 커뮤니티가 Opus 5.5의 성능이 출시 후 몇 주 동안 변하는지, 아니면 소위 '너프'를 당하는지 독자적으로 측정할 수 있는 오픈소스 프로젝트를 공개했어. SWE-bench나 SciCode 같은 검증된 벤치마크를 써서 매일 성능을 추적하고, 표준화된 과학적 방법론을 적용해서 시간 경과에 따른 변화를 측정 가능하고 재현할 수 있게 만들었지. Opus 5.5 성능 추적에 관심 있는 형들은 여기 저장소 확인해 봐:
https://github.com/ninjahawk/livenerf
아직 평가 단계라 미리 말해두는데, 오늘 성능 좀 떨어졌다고 벌써 너프 당한 거 아니냐고 묻는 사람들이 있더라고. 근데 그건 모델 출시 후 20일은 지나야 데이터가 나와. 그러니까 결론 내려면 아직 2주 정도 더 기다려야 해. 오늘 떨어진 수치는 10일 차에 잡힐 기준선에 포함될 예정이야.
그리고 내가 데이터를 어떻게 수집하는지 다들 한 번씩 봐줬으면 좋겠어. 앞으로 더 많은 벤치마크를 돌릴 계획인데, 개선할 점 있으면 의견 좀 내줘. 이거 다 내 사비로 운영하는 거라 캘리브레이션 비용이 꽤 나가거든. Opus 5.5 돌리는 데만 프로 플랜 일주일 치 비용이 깨졌어.
난 투명성을 엄청 중요하게 생각하는데, AI 기업들이 워낙 투명하질 않잖아. 그래서 지금 숨겨진 것들을 밝혀낼 우리만의 도구를 직접 만들기로 한 거야.
LiveNerf 응원해 준 형들 진짜 고마워. 실망시키지 않도록 노력할게. 원래는 그냥 나 혼자 과학적으로 분석해보려고 시작한 건데, 생각보다 커뮤니티 반응이 좋아서 놀랐어. 다들 정말 고마워. 만약 이번 달에 진짜 너프 징후가 포착되면 바로 데이터 정리해서 글 올릴게.
다들 고맙고, 지난번 글 상단 고정해 준 관리자들도 고마워(그건 진짜 예상 못 함).
수정: 문법 교정


