Opus 5를 옹호했었는데, 생각이 바뀌었음
I defended Opus 5 - and then I realised otherwise
핵심 요약
Opus 5의 성능과 효율성에 실망한 사용자가 겪는 복잡한 감정과 워크플로우에 대한 토론.
- 성능 실망 — 벤치마크와 달리 실제 작업에서는 기대에 미치지 못함
- 비효율적 작업 — 간단한 요청에도 과도한 시간과 복잡한 코드를 생성함
- 워크플로우 대안 — Fable을 기획자로 활용하는 방식이 대안으로 제시됨
- 모델 신뢰도 — 벤치마크 수치보다 실제 사용 경험이 훨씬 중요함
Opus 5. 와, 지금까지 중 가장 이상하고 독특한 모델임. 순수 성능 면에서가 아니라, 실제로 그 사고 과정을 읽고 분석해 보니 정말 흥미로움.
뭐 하나 하는 데 시간도 엄청나게 오래 걸림. (자기 작업의) 오류를 찾아내는 건 잘하지만, 명시적인 계획과 범위 설정 없이는 Anthropic이 떠드는 수준에는 못 미치는 것 같음. 끊임없이 말이지. 직원들한테서 듣는 소리는 이 모델이 정말 좋고 똑똑하고 엄청난 업그레이드라는 말뿐인데, 정작 이걸 써본 사람들한테서 읽는 건 정반대의 이야기뿐임.
좋긴 한데, 덕분에 내가 보는 모든 벤치마크를 불신하게 됐음. 이 모델은 벤치마크와는 별개로 Fable 5 수준과는 거리가 멀거든.
애증의 관계랄까. 정말 좋아하는 여자인데, 항상 내 하루를 망치려고 뭔가를 하는 그런 느낌임.
내 생각에 이 모델은 병렬 처리 능력도 뒷받침되지 않은 상태에서 너무 풀어놓은 것 같음. (모든 면에서) 핵심을 빙빙 돌리고 불필요하게 시간을 더 잡아먹는 느낌임.
좋긴 함. 그냥 '그 정도로' 좋지는 않을 뿐. 이 모델을 비판했던 사람들한테는 미안하지만, 성능은 둘째치고 사용하기 정말 짜증 나는 모델임.

