PSA: llama.cpp가 이제 MTP 비활성화 상태에서도 모든 draft-mtp 아키텍처에 대해 기본적으로 MTP 텐서를 로드함
PSA: llama.cpp now loads MTP tensors by default for any draft-mtp arch, even with MTP disabled
핵심 요약
최근 llama.cpp 업데이트로 MTP 사용 여부와 관계없이 관련 텐서가 기본 로드되어 VRAM/RAM 사용량이 증가하는 문제가 발생했습니다.
- MTP 텐서 강제 로드 — MTP 기능을 사용하지 않아도 관련 텐서가 기본적으로 메모리에 적재됨
- 메모리 사용량 증가 — 대부분의 GGUF 모델이 MTP 블록을 포함하고 있어 VRAM/RAM 점유율이 상승함
- 코드 품질 논란 — 커뮤니티에서는 이번 변경 사항이 충분한 검토 없이 머지되었다며 비판함
- 해결책 부재 — 현재로서는 해당 기능을 비활성화할 방법이 없으며 업데이트 보류가 권장됨
GGUF 파일에 MTP/NextN 텐서가 포함되어 있다면(GLM-5.2, hy_v3, qwen35moe, step35 등), 최근 llama.cpp 빌드는 --spec-type draft-mtp 옵션을 전달하지 않아도 기본적으로 해당 텐서를 로드합니다. 이전에는 추론(speculative decoding)을 실제로 활성화하지 않으면 건너뛰던 것들이었습니다.
대부분의 커뮤니티 GGUF 모델은 MTP 블록을 기본적으로 포함하고 있기 때문에, MTP 사용 여부와 관계없이 로드할 때마다 추가적인 VRAM/RAM 사용량(약 1개의 MoE 레이어 분량)이 발생합니다.
