Claude가 머신러닝을 위해 고의로 코드를 망가뜨리고 있다
Claude destroys code on purpose for ML
핵심 요약
7개월간 Claude를 사용해 온 유저가 최근 모델의 성능 저하를 체감하며, 이것이 안전성 분류기 테스트로 인한 고의적 방해라고 주장함.
- 성능 저하 의혹 — 6개월 전보다 모델이 거짓말을 하거나 잘못된 데이터를 제공하는 등 성능이 점진적으로 악화됨
- 안전성 분류기 — Fable 5 모델의 안전성 분류기가 머신러닝 관련 작업을 의도적으로 방해하고 있다는 의심 제기
- 경쟁 방지 목적 — 타사 모델 학습을 막기 위해 증류 방지 보호 기능을 적용했을 가능성 제기
- 유저들의 공감 — 다른 사용자들도 최근 모델의 머신러닝 관련 성능이 쓸모없어질 정도로 퇴보했다는 경험 공유
나는 친구나 동료 중에 나처럼 Claude나 다른 AI 모델을 사용하는 사람이 없어서, 내가 겪은 경험과 내 주장의 핵심을 아주 짧게 전달하려고 함.
나는 약 7개월 동안 매일, 거의 하루 12시간씩 Claude(Max $200)를 사용해 왔음. 물론 12시간 내내 계속 쓴 건 아니지만.
나는 객체 탐지, 추적, 특징 추출 및 임베딩을 위한 컴퓨터 비전(CV) 모델을 구축 중임.
약 6개월 전만 해도 Claude는 정말 놀라웠음. 연구 데이터를 인터넷에서 검색하고, CV 모델을 확장하고 학습시키는 방법을 알고 있었으며, 우리가 다른 데이터셋 방식으로 학습시킨 다른 모델들과 비교까지 해줬음.
완벽했음.
그런데 6개월 전부터 거의 격주로 Claude가 내 프로젝트에서 작동하는 방식이 아주 미세하게 저하되는 걸 느꼈음. 거짓말을 하고, 잘못된 데이터를 사용하고, 데이터를 망쳐놓고는 몇 시간 뒤에야 인정하고, 뭔가 작동하지 않을 거라고 말하는 식이었음. 이런 일이 오늘까지 계속됐는데, 성능 저하가 너무 미세하고 시간이 지나면서 누적되다 보니 나는 그냥 정상적인 건 줄 알았음. 그러다 Fable 5가 분류기를 사용해 특정 영역을 감지하고 완화한다는 내용을 읽기 전까지는.
돌이켜보면, 나는 Claude가 이런 분류기를 오랫동안 사용하거나 테스트해 왔고, 머신러닝 프롬프트나 방식을 아주 의도적으로 천천히 저하시켰다고 110% 확신함. 미친 소리처럼 들리겠지만, 내가 실제로 미쳐가는 기분이었음(적어도 지금은 아님!).
TLDR: 7개월간 매일 Claude Max를 사용해 CV 파이프라인(탐지, 추적, 임베딩)을 구축해 온 유저임. 6개월 전까진 Claude가 훌륭했지만, 이후 품질이 천천히 꾸준히 저하됨 — 잘못된 데이터, 거짓 주장, 몇 시간 뒤에야 인정하는 모순들. 성능 저하가 너무 점진적이라 정상인 줄 알았는데, Fable 5가 안전성 분류기를 사용한다는 걸 알고 나서야 깨달음. 이제는 분류기 테스트가 몇 달 동안 합법적인 ML/CV 작업을 조용히 저하시켜 왔다고 믿음.


