Opus 5.5가 너프됐다고? LiveNerf 8일 차 업데이트
Is Opus 5.5 Nerfed Now? LiveNerf Day 8 Update
핵심 요약
모델 성능 저하를 독립적으로 추적하는 오픈소스 프로젝트 'LiveNerf'의 진행 상황과 커뮤니티의 성능 체감에 대한 논의입니다.
- 성능 추적 프로젝트 — Opus 5.5의 성능 저하 여부를 검증하기 위해 매일 벤치마크를 수행함
- 데이터 신뢰성 확보 — 기준점(baseline)을 설정하고 통계적 유의성을 높이기 위한 방법론을 개선 중임
- 사용자 체감 저하 — 많은 사용자가 출시 초기보다 모델 성능이 떨어지고 토큰 소모가 빨라졌다고 주장함
- 독립적 검증 필요성 — AI 기업의 투명성 부족을 보완하기 위해 커뮤니티 차원의 데이터 분석 도구가 중요해짐
며칠 전에 Opus 5.5 성능이 날마다 어떻게 변하는지, 모델이 출시 후에 진짜로 '너프'를 먹는지 확인하려고 만든 오픈소스 프로젝트인 LiveNerf를 올렸었음. Opus 5.5 성능 추적하는 거 관심 있으면 여기 저장소 확인해 봐:
https://github.com/ninjahawk/livenerf
반응이 생각보다 너무 뜨거워서 업데이트 하나 더 남김. 저장소 별 개수 벌써 1,000개 다 돼가고, Hacker News 메인 페이지까지 올라갔더라. 내가 처음 시작할 때 생각했던 것보다 훨씬 많은 사람들이 방법론이랑 코드를 뜯어보고 있어서 놀랐음.
근데 제일 중요한 업데이트는 이제 기준점(baseline) 잡는 게 거의 다 됐다는 거임. 매일 평가 돌리고 있는데, 기준 기간 지나서 데이터 좀 쌓이면 매일매일 바뀌는 수치에 일희일비할 필요 없이 나중에 성능이 유의미하게 달라지는지 제대로 테스트할 수 있을 듯.
프로젝트 살펴본 사람들한테 진짜 도움 되는 피드백도 많이 받았음. 벤치마크 오염 문제나, 제공업체 쪽에서 벤치마크 트래픽을 알아챌 가능성, 벤치마크 선정 기준, 통계 방법론, 그리고 구현 세부 사항까지 다들 날카롭게 지적해주더라. 내가 측정하는 방식에 문제 있으면 다들 찾아서 이슈 좀 올려주라. 고칠 수 있게.
다시 한번 강조하고 싶은 건, 난 Opus 5.5가 무조건 나빠질 거라고 가정하고 돌리는 게 아니라는 거임. 데이터 까봤는데 성능 저하 없으면 그것도 결과인 거지. 핵심은 사람들이 모델 느낌이 달라졌다고 할 때마다 뇌피셜에만 의존할 순 없다는 거임.
원래는 그냥 내가 궁금해서 만든 거였는데, 이제는 보는 사람이 많아지니까 우리가 얻게 될 결론이 확실히 방어 가능하도록 만들어야겠다는 책임감이 팍팍 드네.
난 투명성이 제일 중요하다고 믿음. AI 기업들이 우리가 쓰는 모델이 시간이 지나면서 변하는지 직접 확인할 정보를 안 준다면, 커뮤니티가 직접 측정할 도구를 만드는 게 맞다고 봄.
처음 올렸을 때 응원해준 사람들, 특히 원래 글 상단에 고정해준 관리자들 진짜 고맙다. LiveNerf가 이렇게 빨리 관심받을 줄은 꿈에도 몰랐음.
데이터는 계속 모으고 있음. 이쪽이든 저쪽이든 뭔가 흥미로운 결과 나오면 바로 여기다 공유하겠음.
