pi-prefix-cache-compaction 배포
Published pi-prefix-cache-compaction
핵심 요약
vLLM, SGLang, llama.cpp의 프리픽스 캐시를 재사용해 Pi의 대화 요약 속도를 획기적으로 개선하는 도구입니다.
- 캐시 재사용 — 전체 기록을 다시 프리필링하지 않고 기존 캐시를 활용함
- 성능 최적화 — 215k 컨텍스트 기준 요약 시간을 229초에서 86초로 단축함
- 즉각적인 응답 — 컴팩션 후 첫 턴 응답 속도를 69초에서 2초 미만으로 개선함
- 호환성 지원 — vLLM, SGLang, llama.cpp 환경에서 사용 가능함
vLLM / SGLang / llama.cpp의 프리픽스 캐시를 재활용해서 전체 기록을 다시 프리필링할 필요 없이 Pi를 압축하는 방식임.
기존 Pi의 기본 압축 방식은 새로운 시스템 프롬프트 아래에서 대화를 다시 직렬화하기 때문에 서버 캐시 미스가 발생함. 그래서 140k 토큰짜리 세션을 로컬 GPU에서 요약하려면 몇 분씩 걸리는 거임. 이건 마지막 요청 내용에 요약 지시어 하나만 딱 붙여서 다시 보내고, 새로운 컨텍스트를 미리 예열해서 다음 턴부터는 바로 캐시에서 시작하게 만듦.
Qwen3.8-27B를 쓴 2x RTX 3090 환경에서 측정해 봤는데, 215k 컨텍스트 기준으로 중간값이 229초에서 86초로 줄었고, 압축 후 첫 턴은 예열 덕분에 69초에서 2초 미만으로 떡상함. 예상치 못한 상황이 발생하면 그냥 Pi 기본 방식으로 돌아가니까 안심하셈.
설치: pi install npm:pi-prefix-cache-compaction · anthropic-messages 커스텀 프로바이더 전용 · MIT · https://github.com/jagdeepsinghdev/pi-prefix-cache-compaction
