알림: 놓치셨다면 확률적 MTP를 시도해보세요. 산문 생성에서 14% 성능 향상
Reminder: try probabilistic MTP if you missed it. Decode +14% on prose
핵심 요약
llama.cpp에 병합된 확률적 MTP 기능이 산문 생성에서 14%의 성능 향상을 보여주며 주목받고 있습니다.
- 확률적 MTP — llama.cpp에 새롭게 병합된 샘플링 기법임
- 성능 향상 — 산문 생성 작업에서 14%의 효율 개선을 보임
- 최적 설정 — draft-n-max 및 draft-p-min 값이 그리디 샘플링과 유사하게 작동함
- 사용 권장 — 최신 버전으로 업데이트하여 테스트해 볼 가치가 있음
https://github.com/ggml-org/llama.cpp/pull/27694
이제 머지 완료됨. 아직 llama 업데이트 안 했으면 빨리 하셈. draft-n-max / draft-p-min 최적값은 greedy sampling이랑 비슷하게 맞추면 될 듯. 주된 성능 향상은 산문 생성(prose generation) 쪽에서 체감됨.
위 테스트는 thinking이랑 ngram-mod 끄고 돌린 거임.

