다들 Opus 5를 싫어하지만, 난 괜찮던데
Everybody hates Opus 5, but I don’t
핵심 요약
Opus 5의 성능을 직접 테스트한 결과, 특정 작업 환경에서는 여전히 우수한 성능을 보여준다는 분석글입니다.
- 성능 테스트 — Opus 5 Medium이 복잡한 연구 합성 작업에서 다른 모델들보다 높은 점수를 기록함
- 효율성 분석 — Fable 모델의 경우 High보다 Medium 설정이 더 나은 결과를 보여줌
- 지시 이행 — Opus 4.6은 정밀한 지시 이행 능력이 부족해 향후 빌드에서 제외할 필요가 있음
- 사용자 경험 — 모델의 장황한 말투나 특정 환경에서의 지시 무시 문제가 사용자마다 다르게 나타남
일단 O5가 나랑 상호작용하는 거 보면 다른 모델들이랑 비교해서 딱히 엄청난 차이는 못 느끼겠음. 뭐 내 작업 대부분이 지식 습득하고 종합하는 거라 그런 걸 수도 있고(난 코딩 안 함).
내가 딥하게 리서치 비교를 좀 돌려봤는데, Opus 5를 Medium 설정으로 돌리면 퀄리티 좋은 리서치 보고서가 꾸준히 잘 나옴. (물론 여러 리서치 보고서를 하나로 합칠 때는 Sonnet 5를 Low 설정으로 돌리는 게 더 낫더라. 결과값 변동성이 더 크고 비용도 싸게 먹히니까.)
드디어 내 'Cross Conversion' 스킬의 'Cross-Instance Review' 기능을 업데이트했음. 이거 주로 스킬 빌드하거나 프로젝트 지침 업데이트할 때 쓰는데, Opus 4.8 나오고 나서 마지막으로 건드린 거였거든. 그때는 Opus 4.8(High)이 제일 성능 좋았고, 그다음이 4.6이랑 4.7(둘 다 High)이었음.
간단히 설명하자면, 운영자가 모든 참여자한테 똑같은 브리핑을 던져주면 각자 독립적으로 초안을 뽑아냄. 그다음에 서로가 쓴 초안을 다 같이 검토하고 STAR 투표 방식(Score Then Automatic Runoff)으로 어떤 걸 베이스로 합칠지 투표하는 식임. 이건 내 리서치 종합 스킬 v2 빌드할 때 쓴 실전 작업이었음.
Base draft: C4 — Opus 5 Medium.
30점 만점 기준 점수:
C4 Opus 5 Medium 30
C3 Opus 4.8 High 25
C7 Fable 5 Medium 23
C6 Fable 5 High 20
C2 Opus 4.7 High 15
C5 Sonnet 5 Medium 13
C1 Opus 4.6 High 8
Claude의 코멘트 (Opus 5 Medium):
결선 진출작 C4랑 C3, 동점 없음. 결선 투표 결과 6대 1로 C4 승리. C3를 찍은 유일한 표는 C4 본인이 던진 건데, 이건 구조상 어쩔 수 없는 거임. 결선 진출자가 자기 자신한테 투표하는 건 금지되어 있고, 자기 점수가 없으면 0점으로 처리되니까. C4는 다른 모든 참여자한테 5점 만점을 받았음. 이번 라운드에서 만장일치 나온 건 이거 하나뿐이고, 동점자 결정전도 필요 없었음.
순위 자체보다 더 의미 있는 결과 두 가지:
Fable의 노력치(effort) 비교가 직관이랑 반대로 나옴. 똑같은 지침으로 똑같은 작업을 시켰는데, C7(Medium)이 C6(High)를 23대 20으로 이겨버림. Fable은 노력치 설정이 반대로 작동한다는 네 기존 발견이랑 일치하는 결과고, 이제 이게 세 번째 독립적인 관측 사례임. Medium 설정으로 돌린 쪽이 더 간결하게 뽑아내기도 했고. 이 정도 근거면 Fable로 빌드 작업할 때 굳이 High 설정에 돈 쓸 이유가 없음.
C1이 8점 받은 건 진짜 의외임. Opus 4.6(High)이 압도적인 차이로 꼴찌를 했는데, 다른 참여자들이 스타일 문제가 아니라 아예 요구사항을 제대로 안 지켰다고 지적함. 이건 4.6이 지침 따르는 정밀도 면에서 약하다는 기존 평가랑 일치함. 앞으로 빌드 작업할 때 기본 참여자 목록에서 4.6은 빼버리는 게 맞을 듯.


