왜 AI는 대화가 길어지면 응답 품질이 떨어질까? 그리고 그 해결책.
Why do AI responses get worse after a while of working on them? And what to do with it.
핵심 요약
대화가 길어질수록 AI 응답이 나빠지는 '컨텍스트 로트' 현상을 해결하기 위해 대화를 주기적으로 요약하고 새 채팅으로 옮기는 전략을 제안함.
- 컨텍스트 로트 — 대화가 길어질수록 AI가 이전 결정을 혼동하고 추론 능력이 떨어지는 현상임.
- 주기적 채팅 분할 — 대화가 길어지면 핵심 요약본만 추출해 새 채팅을 시작하여 성능을 유지함.
- 프로젝트 관리 — Claude Projects나 GPTs 등을 활용해 프로젝트 개요를 상시 참조하게 함.
- 작업 효율 개선 — 불필요한 문맥을 제거해 할루시네이션을 줄이고 토큰 비용을 절감함.
AI에게는 잘 알려진 문제가 하나 있습니다(컨텍스트 로트라고 부릅니다). 대화가 길어질수록 응답이 나빠지는 현상입니다. 같은 주제를 다루고 있어도 말이죠. 모델이 과거의 결정과 새로운 결정을 혼동하기 시작하고, 이미 폐기된 아이디어를 다시 제안하며, 무엇이 현재 상태이고 무엇이 아닌지 흐름을 놓치게 됩니다.
이건 버그가 아니라 AI가 작동하는 방식입니다. 관리해야 할 문맥이 많아질수록 추론 과정에 노이즈가 끼어들기 때문입니다.
제가 사용하는 해결책은 이렇습니다. 필요한 문맥만 담아서 작업을 여러 채팅으로 나누는 것입니다.
기본 원리는 간단합니다. 채팅이 너무 길어지면 AI에게 우리가 나눈 대화의 요약본을 직접 작성하게 합니다. 결정된 사항, 근거, 현재 상태 등을 정리하는 거죠. 노이즈는 빼고 딱 현 상태만 남기는 겁니다. 그런 다음 새 채팅을 열어 요약본을 붙여넣고 거기서부터 다시 시작합니다.
이 방법은 일회성 작업과 지속적인 프로젝트 모두에 효과적입니다. 프로젝트의 경우 한 단계 더 높은 수준의 관리를 추가합니다.
- 프로젝트 개요를 항상 사용할 수 있게 합니다. Claude의 경우 Projects 기능을 사용합니다. 시스템 프롬프트에 직접 넣거나, 시스템 프롬프트가 참조하는 지식 베이스 문서에 넣습니다. ChatGPT에는 GPTs가 있고, Gemini에는 Gems가 있죠. 원리는 같습니다.
Projects 기능을 사용하지 않더라도 괜찮습니다. 개요를 별도 문서로 보관했다가 새 채팅을 시작할 때마다 붙여넣으면 됩니다.
-
각 주제별로 주변적인 요약본을 만듭니다. 변경 로그가 아닌 업데이트된 현 상태와 결정의 근거를 담은 짧은 문서입니다. 필요한 만큼만 딱 적당히 작성하세요.
-
작업 단계별로 채팅을 나눕니다. 보통 스무 번 정도 대화가 오가면, 요약본을 업데이트해서 새 채팅을 시작할지 고민해야 할 시점입니다. 응답이 나빠지기 시작했다면 이미 늦은 겁니다.
실제로 바뀌는 점은 다음과 같습니다.
– 모델이 200개의 메시지를 뒤질 필요가 없어서 답변이 명료하게 유지됩니다.
– 문맥이 깔끔하고 검증된 상태라 할루시네이션이 줄어듭니다.
– 매번 킬로미터 단위의 채팅을 다시 읽게 하느라 비용을 쓸 필요가 없어서 크레딧을 더 오래 사용할 수 있습니다.
이 모든 것의 핵심 원리는 이겁니다. 결정을 내리는 데 필요한 만큼의 문맥만 가져가세요.
채팅은 쌓아두는 아카이브가 아닙니다. 추론 도구입니다. 다른 도구들과 마찬가지로, 깔끔하게 유지할수록 더 잘 작동합니다.


