Claude Code용 페이징 메모리 하네스 개발 — 긴 세션에서 비용 81% 절감, MIT 오픈 소스
Built a paged-memory harness for Claude Code — 81% cheaper on long sessions, MIT, open source
핵심 요약
Claude Code의 컨텍스트를 가상 메모리처럼 관리하여 토큰 비용을 획기적으로 줄이고 성능을 개선한 오픈 소스 하네스를 개발했습니다.
- 메모리 관리 방식 — 대화 기록 전체를 보내는 대신 필요한 정보만 페이징하여 컨텍스트 비용 절감함
- 비용 효율성 — 긴 세션에서 81%의 비용 절감 효과와 100%의 작업 정확도를 달성함
- 호환성 — 메모리 파일은 특정 SDK에 종속되지 않는 범용 마크다운 형식으로 설계됨
- 성능 검증 — 30턴 이상의 장기 기억력 테스트에서 기존 방식보다 우수한 성능을 입증함
Claude Code 쓰면서 제일 골치 아픈 게 컨텍스트 관리임. 매번 대화 내용 전체를 다 다시 보내자니 비용은 눈덩이처럼 불어나고, 에이전트는 컨텍스트 꽉 차서 점점 멍청해지고 느려짐. 그렇다고 안 보내면 중요한 내용을 다 까먹고. 그래서 아예 방식을 바꿔서, 컨텍스트를 계속 늘어나는 대화 기록이 아니라 '관리되는 가상 메모리'처럼 다루는 하네스를 하나 만들었음.
항상 컨텍스트에 상주하는 작은 파일(절대 어기면 안 되는 규칙 + 현재 작업 상태)을 하나 두고, 나머지는 다 디스크에 있는 일반 마크다운 저장소에 박아둠. 대화 중에 관련 내용이 나오면 한 줄씩 불러오고, 에이전트가 진짜 필요하다고 판단할 때만 전체 내용을 가져오는 방식임. 요청하지도 않은 걸 통째로 다시 보내는 짓은 안 함.
기존 Claude Code랑 똑같은 모델, 똑같은 작업, 똑같은 테스트 조건으로 맞짱 떠서 벤치마크 돌려봄. 메모리 전략만 다르게 해서 짧은/중간/긴 세션 120개 돌린 결과임:
- 짧은 세션 63%, 중간 72%, 긴 세션 84% 비용 절감 — 전체적으로는 81% 저렴함.
- 작업 정확도 100% (기존 방식은 92%). 특히 리콜 테스트(초반에 알려준 사실을 30턴 넘게 지나서 물어보는 거)에서 17/17 전부 성공함. 이건 최근 대화 내용에 운 좋게 걸린 게 아니라 진짜로 기억해낸 거임.
이제 v1이라 완성된 제품은 아님. 결과 보고서에도 보기 좋은 숫자만 적어놓은 게 아니라, 확실한 거랑 아직 불확실한 거 다 적어놨으니까 헤드라인만 보고 덥석 믿지 말고 꼭 읽어보길 바람.
MIT 라이선스고 무료임: GitHub
페이징이 실제로 어떻게 돌아가는지, 만들면서 뭐가 터졌는지 궁금한 거 있으면 다 물어봐라.

