클로드가 달라졌다는 체감
체감 성능과 청구서 앞에서, 개발자들은 클라우드 AI를 다시 저울질하고 있다

이번 주 이야기
클로드의 성격 논쟁: 장황함부터 '퍼마스파이크'까지
Opus 4.7·4.8 출시 이후 '모델이 달라졌다'는 체감 불만이 여러 스레드에서 이어졌다. 사용자들은 클로드의 이상 행동 (출처: 애들아 나 기분이 좀 이상해)을 두고 설교조 답변과 고집스러운 태도를 지적했고, 다른 글에서는 지나친 장황함 (출처: 앤스로픽, 말 많은 거 조절하는 설정 좀 만들어주세요) 때문에 이전 버전으로 되돌아갔다는 호소가 이어졌다.
논쟁은 성능 저하가 실재하는지를 둘러싼 공방으로 번졌다. 한 사용자는 로그 스케일 차트를 직접 재검증 (출처: 이 차트 뭔가 수상해서 직접 수정해 봤습니다 (결과 보고 충격받음!))해 low effort Opus 4.8이 Sonnet 4.6 상위 모드보다 저렴하고 우수하다는 결과를 내놓았고, 다른 글은 이 현상에 '퍼마스파이크 효과' (출처: '퍼마스파이크 효과' 설명: 최근 Claude가 다르게 느껴지는 이유)라는 이름을 붙여 반복된 너프 탓으로 돌렸다. 반대편에서는 프롬프트 방식을 바꾸자 인상이 달라졌다 (출처: Opus 4.8을 3일 써보고 생각이 바뀌었다. '결과가 나쁘다'는 불평은 프롬프트 문제인 듯)는 반론과 모델 자체의 과적합 (출처: Opus 4.8은 학습 과정에서 과적합된 것 같음.) 가능성을 지적하는 분석도 나왔다.
arena 랭킹과 실사용 체감은 서로 어긋나며 논쟁은 결론 없이 남았다. arena.ai 순위 (출처: arena.ai에 따르면 Opus 4.8이 Gemini 3 Pro보다 성능이 떨어진다고 함)에서 Gemini 3 Pro가 Opus 4.8보다 앞섰다는 결과에 여러 사용자는 동의하지 않았고, 출시할 때마다 성능이 떨어진다는 불만 (출처: 왜 출시할 때마다 성능이 더 떨어지는 거지?)과 시스템 프롬프트를 직접 뜯어본 Claude Code 실험 (출처: 실험: Claude Code 프롬프트를 수정해 보니, 엉망인 코드는 Anthropic이 우리를 코더로 보지 않기 때문이라는 걸 (스스로) 증명했다.)까지 겹치며 원인은 벤치마크와 프롬프트, 실제 성능 중 무엇인지 합의되지 않았다.
이번 논쟁은 단일한 성능 저하보다 지표 해석과 사용법이 뒤섞인 신뢰 문제에 가깝다. 벤치마크를 직접 재현하려는 시도가 늘고 있다는 점은 공식 지표에 대한 의심이 커졌다는 신호로 읽힌다. 같은 불만이 다음 버전에서도 반복된다면 벤치마크 공개 방식을 점검할 대목이 될 수 있다.
청구서 충격의 한 주: AI 코딩 비용이 갑자기 보이기 시작했다
같은 주에 여러 벤더에서 동시다발적으로 비용·쿼터 문제가 터졌다. 가 1만 5천 달러에 달했다는 청구서가 공유됐고, 한 신입 개발자는 가 나가 HR의 연락을 받았다고 전했다. 익명 기업이 도 돌았으나 출처가 불분명해 회의적으로 받아들여졌다.
