LM Studio, 드디어 MTP Speculative Decoding 지원 추가
LM Studio finally added support for MTP Speculative Decoding
핵심 요약
LM Studio 0.4.14 베타 버전에서 MTP Speculative Decoding을 활성화하는 방법과 성능 향상에 대한 논의.
- MTP 지원 — LM Studio 0.4.14 베타 버전부터 MTP Speculative Decoding을 공식 지원함.
- 설정 방법 — 모델 로드 시 'Manually choose model load parameters'를 선택하고 MTP를 수동으로 활성화해야 함.
- 성능 체감 — 3090 환경에서 Qwen 모델 사용 시 약 2배 정도의 속도 향상을 경험했다는 후기가 있음.
- 최적화 논란 — 일부 사용자는 llama-server가 LM Studio보다 훨씬 빠르다고 지적함.
0.4.14 Build 2 (Beta) 버전으로 업데이트하고 llama.cpp 엔진이 2.15.0인지 확인하세요.
모델을 로드하기 전에 반드시 "Manually choose model load parameters"를 선택하고 그 안에서 MTP를 활성화해야 합니다. 기본값으로는 꺼져 있습니다.


