Block KV 캐시 스트리밍: 공유 CUDA 페이즈 아레나를 통한 긴 컨텍스트 VRAM 제한 (llama-cpp-turboquant PR #357)
Block KV cache streaming: bound VRAM at long context via a shared CUDA phase arena by giveen · Pull Request #357 · TheTom/llama-cpp-turboquant
핵심 요약
llama.cpp 포크 버전의 KV 캐시 스트리밍 PR에 대한 공유 및 성능 검증 게시물입니다.
- 기술 공유 — Raymond의 KV 캐시 스트리밍 작업을 turboX 및 여러 모델로 확장함
- 성능 검증 — 해당 기능의 가치를 확인하기 위해 철저한 벤치마크를 수행함
- 기능 제안 — llama.cpp 메인 브랜치에 해당 기능이 통합되도록 독려함
github.com
원문 사이트로 이동
결국 내가 개고생한 끝에 내린 결론은, 레이먼드가 훨씬 더 잘 만들었다는 거다. 그래서 걔가 짠 코드를 그대로 가져와서 turboX까지 확장하고, 다른 모델들까지 죄다 지원하게 만들었다(걔는 Qwen 모델만 지원했거든). 그리고 이게 진짜 쓸만한 가치가 있는지 확인하려고 벤치마크를 미친 듯이 돌려봤다.
그러니까 이 공은 전부 레이먼드한테 돌리는 게 맞다. ( https://github.com/RaymondHuang210129/llama.cpp-adaptive-kv-streaming )

