Strix Halo Llama.cpp MTP 벤치마크: 27B는 훨씬 빨라졌고, 35B는 결과가 엇갈림
Strix Halo Llama.cpp MTP Benchmarks: 27B Gets Much Faster, 35B Is Mixed
핵심 요약
Strix Halo 환경에서 MTP 모델을 테스트한 결과, 27B 모델은 성능이 크게 향상되었으나 35B 모델은 워크로드에 따라 성능 차이가 나타남.
- 27B 모델 성능 — MTP 적용 시 긴 문맥 처리에서 생성 속도가 대폭 향상됨.
- 35B 모델 결과 — 생성 속도는 빨라졌으나 프롬프트 처리 속도 저하로 전체 시간은 소폭 증가함.
- 워크로드 영향 — 디코딩이 주를 이루면 MTP가 유리하지만, 프리필 비중이 높으면 성능 이점이 줄어듦.
- 테스트 환경 — AMD Ryzen AI Max+ 395 기반의 Strix Halo 시스템에서 llama.cpp로 측정됨.
TL;DR
모든 모델은 Qwen3.6을 사용함
27B-MTP vs Base 27B (15k single-turn): 전체적으로 더 빠름
- 총 시간 (wall): 87.44s → 77.39s (10.05s 단축 / -11.50%)
- 생성: 7.63 → 16.15 t/s (+111.77% 속도 향상)
- 프롬프트 처리: 279.75 → 244.90 t/s (-12.46% 속도 저하)
35B-MTP vs Base 35B (15k single-turn): 전체적으로 더 느림
- 총 시간 (wall): 20.83s → 23.16s (2.33s 지연 / +11.17%)
- 생성: 48.18 → 56.12 t/s (+16.47% 속도 향상)
- 프롬프트 처리: 972.18 → 811.90 t/s (-16.49% 속도 저하)
27B-MTP vs Base 27B (5-turn chat, ~28.5k context): 엄청난 시간 절약
- 총 시간 (wall): 258.65s → 200.55s (58.10s 단축 / -22.46%)
- 2-5턴 (wall): 211.37s → 155.33s (56.04s 단축 / -26.51%)
- 평균 생성: 7.61 → 17.98 t/s (+136.41% 속도 향상)
- 평균 프롬프트 처리: 254.20 → 207.87 t/s (-18.23% 속도 저하)
35B-MTP vs Base 35B (5-turn chat, ~28.5k context): 거의 비슷하거나 약간 느림
- 총 시간 (wall): 58.86s → 60.24s (1.38s 지연 / +2.34%)
- 2-5턴 (wall): 47.96s → 49.21s (1.25s 지연 / +2.62%)
- 평균 생성: 46.66 → 58.23 t/s (+24.80% 속도 향상)
- 평균 프롬프트 처리: 826.47 → 703.45 t/s (-14.89% 속도 저하)
용어 정의:
wall= 요청 전송부터 전체 응답 수신까지 걸린 실제 경과 시간.pp= 프롬프트 처리량 (토큰/초).gen t/s= 생성 처리량 (토큰/초).

