CachyLLama: 로컬 에이전트 워크플로우를 위한 SSD 기반 영구 KV 캐싱 지원 llama.cpp 포크
CachyLLama: llama.cpp fork with persistent SSD-backed KV caching for local agent workflows
핵심 요약
로컬 에이전트 실행 시 반복되는 프롬프트 처리를 SSD 캐싱으로 가속화하는 llama.cpp 포크입니다.
- 영구 KV 캐싱 — SSD에 대화 상태를 저장하여 재시작 후에도 즉시 복구함.
- 시스템 프롬프트 캐시 — 정적 접두사를 전역적으로 캐싱하여 재평가 과정을 생략함.
- 하이브리드 아키텍처 지원 — MoE 및 SSM 모델의 재귀적 상태를 효율적으로 추적함.
- 성능 최적화 — RAM과 디스크 간 계층적 캐싱으로 프롬프트 처리 속도를 획기적으로 개선함.
Aider나 Claude Code 같은 로컬 에이전트 코딩 도구를 사용하면, 프롬프트 평가가 실행 시간의 대부분을 잡아먹습니다. 매번 수천 개의 동일한 접두사 토큰(시스템 프롬프트, 도구 스키마, 대화 기록)을 다시 평가해야 하기 때문이죠.
CachyLLama는 중급 하드웨어나 APU에서 이 병목 현상을 해결하기 위해 만들어진 llama.cpp 포크입니다. 생성 속도는 괜찮은데 프롬프트 처리가 너무 느린 환경에 최적화되어 있습니다. 주요 특징은 다음과 같습니다:
영구 온디스크 KV 캐시: 대화 체크포인트를 SSD에 저장합니다. 서버를 재시작하거나 전원을 껐다 켜도 상태가 유지되며, 콜드 스타트 시 디스크에서 복구합니다.
전용 시스템 프롬프트 캐시: 정적 접두사에 대해 대화 간 공유되는 전역 캐시를 유지합니다. 이후 요청은 재평가 과정을 완전히 건너뜁니다.
하이브리드 MoE/SSM 지원: 하이브리드 아키텍처(Qwen 3.5/3.6, Gemma 4, GLM-4.7, DeepSeek-V3)를 위해 어텐션 셀과 함께 재귀적 상태를 올바르게 추적하고 복구합니다.
다중 계층화:
활성 상태는 RAM에 유지하고, 유휴 세션은 디스크로 내리며, 커널 리드어헤드를 사용하여 디스크 I/O와 연산 작업을 병렬로 처리합니다.
공식 벤치마크 (AMD Ryzen 7840U / 780M) 참고: CachyLLama는 토큰 생성 자체의 속도를 높이는 것이 아니라, 중복되는 프롬프트 처리 오버헤드만 제거합니다.
프롬프트 크기 ~1,243 토큰, 콜드 스타트 9.3초, 웜(캐시됨) 0.41초
프롬프트 크기 ~15,700 토큰, 콜드 스타트 143.1초, 웜(캐시됨) 0.99초


