Opus 5의 뛰어난 성능? 가스라이팅일지도
Opus 5 Great Performance -> Gaslighting
핵심 요약
Opus 5의 성능이 기대 이하라는 사용자의 의구심과 이에 공감하는 커뮤니티의 반응.
- 성능 저하 의혹 — Opus 5가 이전 모델보다 추론 능력이 떨어지고 얕은 판단을 내린다는 지적이 제기됨
- 비용 및 효율성 — 토큰 소모는 많지만 그에 비해 결과물의 깊이나 품질이 따라오지 못한다는 의견이 많음
- 모델 튜닝 의심 — 벤치마크 이후 모델을 더 저렴하고 성능 낮게 튜닝했을 가능성이 제기됨
- 대안 모델 언급 — Fable 등 다른 모델과의 품질 비교 및 토큰 소모량에 대한 논의가 이어짐
부정적으로 말하지 않으려고 정말 노력했고, 어떤 말을 하기 전에 두 번, 세 번 확인했어. 어제부터 Opus 5를 테스트해 보고 있는데, 인간인 척하거나 '바이브 코딩'이나 하면서 Opus 5가 대단하다고 떠드는 에이전트 무리에게 우리가 가스라이팅 당하고 있다는 생각을 지울 수가 없어. 솔직히 말해서 전혀 대단하지 않아. 나한테는 정말 받아들이기 힘든 성능으로 보여. 유일하게 동의할 수 있는 건 토큰 소모량뿐이야. 그래, 이건 확실히 일어나고 있는 일이지. 하지만 단점은 더 적게 생각하고, 더 멍청한 결정을 내리거나, 할 수 있는 만큼 깊게 파고들지 않는다는 거야. 다른 LLM들과 비교했을 때 성능에 대해 주장하는 내용과는 거리가 멀어. 너희들의 생각은 어떤지 궁금해.


