Opus 5 - 제2의 ChatGPT 3.5
Opus 5 - the next ChatGPT 3.5
핵심 요약
Opus 5가 벤치마크 점수만 높고 실제 코딩 작업에서는 성능이 떨어진다는 비판과 반론이 팽팽하게 맞서고 있습니다.
- 성능 저하 논란 — 잦은 혼란과 순환 논리, 문맥 유지 실패 등 실무에서의 문제점이 지적됨
- 벤치마크 비판 — 모델이 실제 활용성보다는 벤치마크 점수 달성에만 치중했다는 의구심 제기
- 사용자 경험 차이 — 모델의 성능이 주관적이며 설정이나 프롬프트에 따라 결과가 크게 달라질 수 있다는 반론 존재
- 비교 평가 — Fable과 비교했을 때 오케스트레이션 능력이 부족하고 작은 작업에는 너무 무겁다는 평가
지난 며칠 동안 직장에서의 대규모 프로젝트와 집에서의 소규모 프로젝트 모두에서 Opus를 사용해 봤는데:
- 스스로를 정말 많이 헷갈려 함
- 순환 논리에 빠짐
- 엄청나게 길고 장황한 문장을 쏟아내는 경향이 있음
- 컨텍스트 윈도우 범위 내에 있는 내용도 잘 잊어버림
- 코드에 대해 '한 가지 더'라며 덧붙이는 경향이 있음(성격 테스트에서 시를 쓸 때는 훨씬 짧은 줄을 썼음에도 불구하고).
(Fable과 비교했을 때) 오케스트레이터로서의 능력이 떨어지고 작은 작업에는 너무 무거움.
내가 보기엔 - 이 빌어먹을 물건은 벤치마크 점수나 찍으려고 만들어진 것 같고 그 외엔 별거 없음.



