광고하려는 건 아니고 솔직한 생각과 경험을 공유함. 클로드 늦게 입문했는데, 처음엔 4.7 버전이 마법 같았지만 지금은 벤치마크 부풀리기와 과장 광고 때문에 사기처럼 느껴짐.
Not here to shill but just offer genuine thoughts and experiences. I was a late adopter of Claude. At the start it was like magic with 4.7, but now it feels like a hoax with benchflation and marketing that promises a better product than it lives up to.
핵심 요약
클로드 최신 모델의 성능 저하와 과도한 제약에 실망한 사용자가 다른 모델로의 이탈을 고민하며 커뮤니티의 의견을 묻는 글.
- 성능 저하 논란 — 최신 모델이 이전 버전보다 사용하기 어렵고 비효율적임
- 과장된 벤치마크 — 마케팅용 지표와 실제 작업 체감 성능 간의 괴리가 큼
- 사용성 문제 — 모델의 지나친 문자주의적 태도로 인해 생산성 도구로서의 가치가 떨어짐
- 대안 탐색 — 클로드의 제약과 복잡함에 지쳐 GPT 5.6 등 타 모델로 눈을 돌리는 중
tl;dr, opus 4.6과 4.7은 내 작업(주로 학술 연구)에 정말 훌륭했지만, Opus 4.8과 5.0 이후로는 GPT 5.6을 써보고 나니 다시 돌아갈 생각이 있는지 잘 모르겠음.
Anthropic이 Fable을 다루는 방식은 정말 치졸했음. "다시 쓰려면 장기라도 기증해야 할 것 같은 10일간의 체험판을 줄게"라고 했다가, GPT가 경쟁력을 갖추니까 "이제 플랜에 포함됐어요 여러분 :D"라고 하는 건 정말 비열했음. 하지만 더 중요한 건, Opus 4.6의 편리함에서 4.8의 존재 자체가 고통인 수준으로, 그리고 5.0은 반쯤 이중 스파이 같은 상태가 되면서 결국 Anthropic과 그 제품들을 더 이상 신뢰하지 않게 됐다는 점임.
이 모든 것들, 특히 Opus의 소통 방식과 Fable 플랜의 인색함 때문에 결국 GPT 5.6을 써보기로 했음. 그리고 한마디만 하자면, 아직 안 써봤다면 꼭 써보길 강력히 추천함. Fable과 비슷한 성능을 내면서도 실제로 일을 끝낼 수 있음.
하지만 더 중요한 건, 베이스 모델이 작업하기에 악몽 같은 수준이면 벤치마크는 아무런 의미가 없다는 걸 깨달았다는 거임. 살면서 Opus만큼 복잡한 건 처음 경험해 봄. 상식보다는 문자 그대로만 받아들이는 태도는 생산성 도구라기보다는 퍼즐을 푸는 것 같음. 웃긴 건, 우리가 이 모델이 작업하기에 끔찍하다는 사실을 받아들이고 있다는 거임. 왜냐하면 떠나면 손해라는 벤치마크 수치에 세뇌당했기 때문이지. 하지만 우리가 원했던 결과물이 아닌데도, 원하는 것과 비슷하게라도 만들기 위해 Opus와 싸우느라 너무 지쳐버린다면, 그런 '성능' 지표가 다 무슨 소용인가 싶음.
다른 사람들은 Opus 5와 5.6을 쓰면서 어떤 경험을 했는지 궁금함. 특히 학술 연구용으로 쓰는 사람들은 더더욱.

