Anthropic은 어떻게 Opus 4.8 같은 훌륭한 전작들을 두고 Opus 5를 이렇게 망쳐놓았을까? 진지한 질문임
How did Anthropic get Opus 5 so wrong from great predecessors like 4.8? Serious question here
핵심 요약
사용자들은 Opus 5의 성능 저하와 장황함을 비판하며, 여전히 4.6 버전을 최고로 꼽고 있습니다.
- 모델 성능 저하 — Opus 5가 이전 모델들에 비해 장황하고 신뢰성이 떨어진다는 비판이 지배적임
- 4.6 버전 선호 — 많은 사용자가 여전히 황금기였던 4.6 버전을 코딩 및 일반 작업에 사용 중임
- 급조된 모델 의혹 — Opus 5가 경쟁 대응을 위해 벤치마크 점수 위주로 급하게 학습된 결과물이라는 분석이 있음
- 사용자 경험 차이 — 코딩 작업에서 Opus 5가 더 낫다는 의견과 퇴보했다는 의견이 엇갈리며 논쟁 중임
Opus 5는 이전 모델들과는 다른 새로운 사전 학습 가중치 세트였을까?
아니면 사전 학습 가중치는 그대로인데 후속 학습(post training) 과정에서 뭐가 잘못된 걸까?
그것도 아니면 Opus 5의 특정 하네스(harness) 문제인가?
Opus 5의 장황함과 신뢰성 문제는 이미 몇 주째 사용자들 사이에서 엄청나게 까이고 있는데, 앤스로픽은 도통 해결책을 못 찾는 것 같다. 그럼 이 문제가 이 모델 자체에 깊게 박혀 있는 근본적인 결함이라는 뜻인가?
진짜 궁금해서 미치겠네.


