모든 Claude 모델이 심각하게 너프됨
All Claude models got nerfed BADLY
핵심 요약
Claude 모델의 성능 저하를 주장하는 글에 대해 사용자들 사이에서 의견이 극명하게 갈리고 있음.
- 성능 저하 논란 — 사용자들이 Claude 모델의 지능과 응답 품질이 이전보다 떨어졌다고 주장함.
- 확증 편향 의혹 — 일부 사용자는 모델의 확률적 특성을 이해하지 못한 채 일시적인 변동을 성능 저하로 오해한다고 지적함.
- 마케팅 전략 의구심 — 기업이 신규 모델 출시 시 일시적으로 성능을 부풀린 후 나중에 하향 조정한다는 음모론이 제기됨.
- 사용자 경험 차이 — 모델의 성능 변화가 사용자마다 다르게 나타나는 현상을 두고 시스템 프롬프트나 롤아웃 방식의 차이일 가능성이 거론됨.
말도 안 될 정도로 너프됐음. 지금 Opus 4.8 Max를 쓰는 게 예전 Haiku 모델을 쓰는 것보다 더 안 좋게 느껴질 때가 많음. 생각할 시간도 거의 안 갖고, 제대로 된 조사도 안 하며, 계속 사용자를 가스라이팅함.
전반적으로 사람들이 LLM 모델에 흔히 제기하는 문제인데, 여기서는 뻔뻔할 정도로 증폭됨.
특히 짜증 나는 건 Opus 4.8 출시 전체가 진실 추구와 환각 감소에 대한 약속에 집중했다는 점임. 그런데 그 약속들은 실현되지 않은 것 같음. 내 생각엔 출시 때 본 건 그냥 Opus 4.6의 일시적으로 부스트된 버전이었고, 엄청난 도약을 한 것처럼 보이게 하려고 만든 환상 같음.
내 추측으론 AI 시장은 과대광고와 미래 기대치로 돌아감. 기업들은 끊임없이 빠른 발전이라는 서사를 팔아야 하고, 그 인식을 강화하는 한 가지 방법은 새 모델이 훨씬 좋아 보이게 만드는 것임. 일시적인 부스트를 주거나, 뛰어난 능력의 아우라를 씌우거나, 심지어 공포심(Fable 5처럼)을 조장하거나, 아니면 조용히 구형 모델을 퇴화시키는 식임. 그 사이클이 다시 반복되는 걸 보게 될까 봐 걱정됨.
또 다른 가능성은 이 '너프'가 일관되게 적용되지 않는다는 거임. 서로 다른 버전, 기능, 시스템 프롬프트가 서로 다른 사용자 그룹에 다른 시기에 배포될 수도 있음. 만약 그렇다면 사용자들이 경험을 비교하고 서로의 관찰을 검증하기가 훨씬 어려워질 거고, 광범위한 문제가 회사 차원의 관행이 아니라 개별적인 사건처럼 보이게 될 거임. 물론 이건 내 추측일 뿐이지만, 왜 모델 행동에 대한 보고가 동시에 이렇게 극적이고 일관되게 다를 수 있는지 설명이 됨.


