신규: Llama.cpp 추론 속도 향상을 위한 적응형 추측(Adaptive Speculation)
New: Llama.cpp adaptive speculation for faster inference
핵심 요약
Llama.cpp의 추론 성능을 최대 50%까지 높여주는 적응형 추측 기능이 공개되었습니다.
- 적응형 추측 기능 — 콘텐츠 유형에 따라 토큰 생성 수를 자동으로 조절함
- 성능 향상 — Strix Halo 환경에서 구조화된 콘텐츠 생성 속도가 44t/s에서 65t/s로 증가함
- 기술적 차별점 — 기존 MTP와 DFlash를 결합하여 동적으로 추측 길이를 최적화함
- 오픈소스 공개 — GitHub를 통해 포크 버전 및 릴리스 확인 가능
Qwen3.8이랑 다른 모델들 성능 최적화 좀 만져봤다.
이번에 새로 넣은 핵심 기능은 Llama.cpp용 적응형 추론(adaptive speculation)이야.
이게 뭐냐고?
MTP랑 DFlash가 추론 속도 올리는 데는 꽤 괜찮거든, 특히 덴스 모델에서 말이야. 근데 콘텐츠 종류마다 필요한 설정값이 다 다르단 말이지. 기존 Llama.cpp는 딱 하나의 값만 지원했어.
이번 포크 버전에는 적응형 추론을 도입했어. 최소값이랑 최대값만 설정해두면 엔진이 알아서 추천 토큰 수를 조절해. 덕분에 메인라인 대비 토큰 생성 속도가 최대 50%까지 빨라졌는데, 특히 Qwen3.8에서 효과가 좋아. Strix Halo 환경에서 테스트해보니까 구조화된 콘텐츠 기준으로 44t/s에서 65t/s까지 뻥튀기되더라.
Github: https://github.com/LaurentZuijdwijk/llama.cpp
Release: https://github.com/LaurentZuijdwijk/llama.cpp/releases
https://www.reddit.com/submit/?source_id=t3_1vxx51g&composer_entry=crosspost_prompt
