llama.cpp에 speculative checkpointing 기능이 병합됨
llama.cpp speculative checkpointing was merged
핵심 요약
llama.cpp에 speculative checkpointing이 추가되어 특정 작업에서 추론 속도 향상을 기대할 수 있게 됨.
- 기능 병합 — llama.cpp에 speculative checkpointing이 추가되어 추론 속도 개선이 가능해짐.
- 성능 최적화 — 작업 유형과 반복 패턴에 따라 0%에서 50%까지 속도 향상 효과를 볼 수 있음.
- 추가 기능 논의 — DFlash나 SYCL/Vulkan 백엔드 최적화 등 다른 성능 개선 방안들도 함께 언급됨.
- 사용자 반응 — 새로운 기능에 대한 기대감과 하드웨어 제약에 대한 현실적인 고민이 공존함.
https://github.com/ggml-org/llama.cpp/pull/19493
어떤 프롬프트는 속도가 빨라지지만, 그렇지 않은 경우도 있음(낮은 draft acceptance streak 사례).
작업 유형과 반복 패턴에 따라 적절한 파라미터가 달라짐.
코딩 작업의 경우, 다음 파라미터로 0%~50%의 속도 향상을 경험함:
--spec-type ngram-mod --spec-ngram-size-n 24 --draft-min 48 --draft-max 64

