"Claude가 멍청해졌다"는 글 절반은 그냥 컨텍스트 오염 때문임. 해결하니까 불만 싹 사라짐
Half the "Claude got dumber" posts are just context rot. fixed it and the complaints went away
핵심 요약
Claude의 성능 저하 문제는 모델 자체의 결함이 아니라, 실패한 대화 기록이 쌓여 발생하는 컨텍스트 오염 때문일 가능성이 큼.
- 컨텍스트 오염 — 실패한 대화 기록이 모델의 추론을 방해함
- 세션 초기화 — 두 번 이상 실패 시 새 세션에서 다시 시작하는 것이 효과적임
- 모델 비교 — 다른 모델로 바꾸면 잘 되는 이유는 새 컨텍스트 덕분임
- 리셋 기준 — 모델이 컨텍스트 윈도우 절반을 넘기기 전에 초기화하는 습관이 필요함
최근 "버그 하나 고치는 데 15번이나 시도했다"는 글들을 계속 봤는데, 솔직히 나도 한동안 같은 경험을 했음. 그러다 모델이 문제가 아니라 컨텍스트가 문제라는 걸 깨달았지.
무슨 일이 벌어지는 거냐면, 한 채팅창에 실패한 시도들이 가득 차면 모델이 자기 자신의 틀린 답변들을 바탕으로 추론을 시작함. 이전의 쓰레기 같은 답변들을 진실인 것처럼 읽고 계속 같은 막다른 길을 파고드는 거지. 그러니까 모델이 문제를 못 푸는 게 아니라, 자기 자신의 기록에 빠져 허우적대는 거임.
나한테 모든 걸 바꾼 해결책은 정말 단순함. 모델이 두 번 틀리는 순간, 난 멈춤. 계속 대화를 이어가며 바로잡길 기대하지 않음. 어차피 안 되니까. 관련 코드나 컨텍스트를 복사해서 완전히 새로운 세션을 시작하고 깔끔하게 붙여넣음. 십중팔구 거의 즉시 해결됨. 사람들은 이걸 보고 "다른 모델이 더 똑똑하네"라고 착각하지만, 사실은 오염된 컨텍스트 대신 새로운 시각을 얻었을 뿐임.
버그 수정 중에 ChatGPT로 바꾸면 마법처럼 해결되는 것도 같은 논리임. 항상 더 뛰어난 두뇌라서가 아니라, 짐이 없는 컨텍스트이기 때문임.
이제 내가 따르는 경험칙: 컨텍스트 윈도우의 절반이 넘어가면 모델을 절대 믿지 말고, 한 스레드에서 두 번 이상 실패하게 두지 말고 리셋할 것.
다들 리셋하는 기준이 뭔지 궁금함. 두 번 실패? 아니면 특정 토큰 수? 이 주제에 대해 다들 충분히 이야기하지 않는 것 같음.


