Claude 코드 품질에 대한 진지한 질문, 비난이나 공격 의도 없음
Serious question regarding CC quality, no hate or flame
핵심 요약
최근 Claude의 코드 생성 품질이 급격히 저하되었다는 사용자의 불만과 이에 대한 커뮤니티의 다양한 분석 및 대응책 공유.
- 품질 저하 논란 — 최근 3개월간 Claude의 코드 생성 능력과 추론 성능이 눈에 띄게 퇴보함
- 사용자 대응책 — 프롬프트 엔지니어링이나 서브 에이전트 활용 등 다양한 시도를 해보지만 효과가 미미함
- 성능 최적화 — 5 시리즈 모델은 멀티 패스나 에이전트 루프 패턴에 최적화되어 있어 기존 방식과 차이가 있음
- 비용 절감 의혹 — Anthropic이 컴퓨팅 자원을 아끼기 위해 의도적으로 성능을 제한하고 있다는 사용자들의 추측
지난 3개월 동안 Claude 품질이 개박살 나는 걸 똑똑히 지켜봤다. 특정 모델만의 문제가 아님 (Opus 5는 그 자체로 재앙 수준이지만).
이건 뭐 "프롬프트 탓"이니 "실력 문제"니 하는 수준을 넘어섰음.
코드 리뷰하다가 실수 잡아내고, 질문 던져서 틀린 내용 확인하고, 다른 LLM으로 교차 검증까지 해보면서 뭐가 언제 왜 잘못됐는지 항상 분석함. Codex랑 Claude 둘 다 이렇게 관리하고 있고, 모델별로 에러 유형 리스트까지 만들어 놨음.
분석을 계속하다 보니 Claude가 어떤 식으로 멍청한 짓을 하는지 훤히 보이더라. 최근 1~2주 동안은 새로운 유형의 에러는 안 보이는데, 에러 빈도가 진짜 공포스러울 정도임. 농담 아니고 매 턴마다 틀린 소리를 하거나 잘못된 가정을 깔고 가고, 일 처리가 하도 엉망이라 잘 돌아가던 코드까지 다 망가뜨려 놓음.
몇 달 전만 해도 이 정도는 아니었음. 지금 얘네가 내놓은 모든 모델에서 똑같이 나타나는 현상임.
"실력 문제" 운운하는 놈들한테 한마디 하자면, 난 프롬프트 하나 짤 때도 제약 조건이랑 범위 설정까지 엄청 공들여서 함. 모호한 구석 하나 없이 정교하게 짜고, 결정론적 체크를 위한 장치도 여러 개 걸어둠. 근데도 Claude는 가치를 창출하기는커녕 시간이랑 토큰만 더 잡아먹음. 진짜임.
Codex 광고하려는 거 아님. 걔도 결함 많고, 난 어느 회사 제품인지 따위 관심 없음.
진심으로 궁금해서 묻는 건데:
- 내가 시간이 지나면서 예민해져서 Claude가 싸지르는 똥을 하나하나 다 잡아내는 건가?
- 아니면 진짜로 유료 구독 모델 품질이랑 추론 능력이 개판 난 건가?
- 어그로 끌리는 거 알지만 알 바 아님: 그냥 내가 멍청해서 뭘 잘못하고 있는 거고 너희들은 다 해결책을 찾은 건가?
- 아니면 다들 Claude가 이 정도로 똥을 싸는데도 Fable 같은 데서 나오는 "완료", "끝" 같은 자신감 넘치는 말만 믿고 속은 곪아 터지고 있는 걸 모르는 건가?
이게 대체 뭔 상황인지, 아니면 이 중에 뭐가 섞여 있는 건지 진짜 궁금하다.
