Claude 4.6이 전성기였고 그 이후로는 내리막길임
Claude 4.6 was peak and it's downhill since then
핵심 요약
사용자들은 최신 Claude 모델들이 이전보다 장황하고 불필요한 기술을 요구하며 성능이 퇴보했다고 비판합니다.
- 모델 성능 퇴보 — 최신 모델들이 이전보다 장황하고 인간답지 않은 영어를 구사함
- 불필요한 복잡성 — 모델을 제대로 쓰기 위해 별도의 스킬이나 플러그인이 강제됨
- 비용 효율성 저하 — 토큰 소모가 심해지고 반복적인 수정이 필요해짐
- 경쟁 모델 선호 — GPT 6 등 타 모델이 별도 설정 없이 더 나은 성능을 보여줌
클로드 2년 넘게 써오면서 느낀 건데, 클로드의 전성기는 Opus 4.6 시절이었음. 그때는 얘가 하는 말을 우리가 제대로 이해할 수 있었고, 시키는 대로 일도 잘했거든. 물론 엄청 똑똑한 건 아니었어도 가성비 좋게 할 일 다 해냈고, 덕분에 이것저것 많이 만들 수 있었지.
Opus 4.6 이후로 나오는 모델마다 "새로운" 지능 수준을 보여준다고 떠들어대는데, 막상 써보면 죄다 쓰레기 같은 영어만 내뱉음. (다른 언어들도 테스트해 봤는데 사람이 읽을 수 있는 수준이 아님). "새롭고 더 강력하다"는 이유로 가격은 올랐는데, 그 강력함이라는 게 고작해야 모델이 좀 더 길게 말하게 만들고, 아무도 안 물어본 '주의사항'이나 맹점 같은 걸 찾아내서 아는 척하느라 정작 시킨 일은 제대로 못 하는 새로운 시스템 프롬프트가 다인 것 같음.
지난 1년 동안 AI 인플루언서들이 "자, 여기 새로운 스킬 알려줄게..."라면서 영상 올리는 거 지겹게 봤음. 다들 아무도 원하지 않았던 문제들을 해결하겠답시고 난리인데, 이제는 AI한테 말하는 법, 프론트엔드 디자인하는 법, 그냥 사람답게 도움 되는 법까지 일일이 가르쳐야 함. 스킬 도입하느라 토큰은 더 잡아먹고, 컨텍스트 좀 쌓인다 싶으면 펑 하고 다 날아가서 처음부터 다시 지시해야 하니 토큰만 더 빨리 소모됨.
작년까지만 해도 AI 성능을 높이려면 어쩔 수 없이 감수해야 하는 부분이라고 생각했음. 코딩 잘하게 만들려면 바보처럼 말하게(예를 들어 원시인 스킬 같은 거) 만들어야 한다면 그렇게라도 해야지 싶었거든. 똑똑한 모델을 원하면 다른 건 좀 포기해야 한다고 생각했는데, GPT 6를 내 프로젝트에 써보고 생각이 싹 바뀌었음. 스킬 하나도 안 쓰고 그냥 순정 상태로 돌려도 성능이 미쳤더라.
나만 그런 건지 모르겠는데, GPT 6는 별다른 설정 없이도 바로 실전 투입이 가능함. 반복 작업 많이 안 해도 시킨 대로 딱딱 해내고, 뭐 할 때마다 스킬이나 플러그인 깔 필요도 없음. Fable 5.1처럼 찌꺼기 같은 결과물 일일이 수정하라고 가르칠 필요가 없으니 결과적으로 비용도 훨씬 적게 듦. 무엇보다 사람이 쓰는 진짜 영어가 뭔지 제대로 알고 있음.
지금 내가 클로드 계속 쓰는 유일한 이유는 OpenAI가 아직 x20 구독을 막아놔서임. 클로드가 GPT 6랑 제대로 경쟁하려면 (깔끔한 문장 구사, 쓸데없는 소리 줄이고 일 제대로 하기, 반복 작업 최소화, 스킬 의존도 낮추기, 가성비 개선) 이 모든 걸 다 개선해야 하는데, 솔직히 가능할지 모르겠음. 너희들은 어떻게 생각함?
EDIT : 댓글 보니까 내 글 요지를 잘못 파악한 사람들이 많은데, Opus 4.6이 더 낫다는 소리가 아님. 분명히 말하지만 기술적으로는 Fable 5.1이 가장 뛰어난 모델인 게 맞음. 내 말은 Opus 4.6이 전체적으로 가장 밸런스가 잘 잡힌 모델이었고, 그 이후로 나온 모델들은 하나는 잘하는데 나머지는 다 나사가 빠져 있다는 거임. 그리고 지금 시점에서 Opus 4.6 이후로 가장 밸런스 잘 잡힌 모델은 GPT 6라고 말하는 거임.


