MTP와 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 조합 성능 테스트 - llama.cpp
MTP+GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 - llama.cpp
핵심 요약
MTP와 통합 메모리 설정을 조합해 Q8 모델에서 속도 향상을 확인한 테스트 공유.
- 성능 향상 — MTP와 통합 메모리 조합으로 Q8 모델에서 초당 토큰 처리량 증가함.
- 하드웨어 사양 — RTX5090과 128GB RAM 환경에서 Qwen3.6-27B 모델을 테스트함.
- 품질 논쟁 — 속도는 빨라졌으나 모델의 추론 품질 저하 여부에 대해 의견이 갈림.
- 통합 메모리 — OOM 방지용 설정이지만 모델 연산 방식에 차이를 만든다는 주장이 있음.
결과 차이가 궁금해서 테스트해봄: GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 vs MTP+GGML_CUDA_ENABLE_UNIFIED_MEMORY=1
결과가 꽤 흥미로움: MTP 없이 49tok/sec vs MTP 사용 시 64 tok/sec.
PC: RTX5090+128GB DDR5 5600 CL36+Ryzen 9 9950X3D
모델: Qwen3.6-27B-Q8_0.gguf (Unsloth with MTP)
명령어:
CUDA_VISIBLE_DEVICES=0 GGML_CUDA_ENABLE_UNIFIED_MEMORY=1 /home/marcin/llama-server \
-m /home/marcin/Pobrane/Qwen3.6-27B-Q8_0.gguf \
--threads 16 \
-c 262144 -fa on -np 1 \
--spec-type mtp --spec-draft-n-max 3 \
--webui-mcp-proxy \
--chat-template-kwargs '{"preserve_thinking": true}' \
--host 0.0.0.0 \
--port 8090 \
--jinja
