Opus 4.7은 진짜 최악이다
Opus 4.7 is beyond bad
핵심 요약
Claude 3.5 Opus 4.7 모델의 성능 저하와 잦은 오류에 대한 사용자들의 불만과 비판이 이어지고 있음.
- 성능 저하 논란 — 이전 버전인 4.6 대비 4.7 모델의 추론 능력과 코드 생성 품질이 현저히 떨어짐.
- 메타 하네스 구축 — 모델의 불안정한 성능에 대응하기 위해 사용자가 직접 모델 독립적인 하네스를 개발 중임.
- Anthropic 투명성 요구 — 모델 성능 변화에 대한 명확한 공지와 합리적인 가격 책정을 요구하는 목소리가 높음.
- 반복되는 출시 주기 — 과거 모델들도 초기에는 성능 이슈가 있었으나 이후 개선되었던 전례를 언급하며 4.8/5 시리즈를 기다리는 분위기.
나는 점점 길어지는 실패 사례 문서를 가지고 있는데, 최근 다른 모델 출시에서는 흔히 볼 수 없었던 것들이 많다. 내 추측으로는 이게 'OpenClaw' 형님들을 만족시키려고 harness와 meta-harness 용으로 튜닝된 작은 베이스 모델인 것 같다. 한동안 내 아키텍처의 핵심 생성 모델로 4.6을 썼는데 아주 훌륭했다. 그러다 어느 순간 성능이 좀 저하된 것 같았고(COT 문제가 아니라 베이스 모델 자체가 작아진 느낌). 그러다 4.7이 나왔는데, 두 번 주고받아 보고 바로 냄새를 맡았다. 그 '작은 모델' 특유의 냄새 말이다. 이제는 4.6에서의 고정된 추론 노력이 'deprecated(지원 중단)' 되었다고 하니, 조만간 OpenAI나 4.5, 4.7 중 하나로 갈아타야 할 텐데, 다 하나같이 별로다.
Anthropic, 제발 좀. Claude Code에서 예전 Opus 4.6 같은 괜찮은 거 좀 내놔라. 필요하면 돈 더 낼게.
4.7에 대해 유일하게 칭찬할 점은 내 meta-harness를 다듬는 데 도움이 된다는 거다. 얘가 크게 삽질할 때마다 다음엔 그걸 막을 방법을 찾게 되니까. 나중에 모델을 바꿔 끼울 때 도움이 될 거다.
PS: 사람들이 'meta-harness'라는 용어를 잘 안 쓰는 것 같은데, 확실히 말하자면 Claude Code가 하나의 harness라면, 나는 그 위에 또 다른 harness를 만들고 있다는 뜻이다. 어쨌든 나는 내 harness가 그 아래에 어떤 harness가 있든 상관없게 만들 생각이다. 제공업체들이 좋은 걸 내놓고 일관성 있게 유지하질 못하니까.
Anthropic, 이해한다. 컴퓨팅 비용 비싸지. 근데 가격을 그에 맞게 책정하고, 사람들에게 실제로 뭘 제공하는지 좀 더 투명하게 밝혀라.

