Headless RTX 3090에서 Qwen3.6 27B 모델로 돌려본 Llama.cpp MTP 성능 테스트
Llama.cpp MTP with Qwen3.6 27B on Headless RTX 3090
핵심 요약
Llama.cpp의 MTP 기능을 사용해 85k 토큰 처리 시간을 41% 단축한 실사용 후기.
- MTP 성능 향상 — 85,000 토큰 처리 시 전체 시간을 39분에서 23분으로 41% 단축함.
- PP 속도 저하 — MTP 적용 시 Prompt Processing 속도는 42% 감소했으나, Token Generation 속도는 85% 증가함.
- 실사용 환경 — Headless RTX 3090 24G 환경에서 Qwen3.6-27B-MTP 모델을 사용하여 테스트함.
- 듀얼 에이전트 활용 — 메인 에이전트와 비평 에이전트를 조합해 코딩 작업의 성공률을 높임.
PP 속도가 느려진다는 글들을 좀 봐서 다들 조심스러워하는 것 같더라고.
여기 실사용 데이터 포인트 하나 공유할게.
설정:
- Headless RTX 3090 24G
- OpenCode
- 모델: unsloth's Qwen3.6-27B-MTP-Q4_K_M.gguf
- 128k 컨텍스트
- q8_0 kv 캐시
- --spec-draft-n-max: 3
- --draft-p-min: 0
사용 사례:
- 약 85,000 토큰을 사용하는 연구 작업
- 약 85,000 토큰을 사용하는 코딩 작업
MTP 미사용 시 (llama.cpp:server-cuda13-b9174):
- PP: 1,050 tok/s
- TG: 27 toks/s
- 85k 토큰 완료까지 걸린 총 시간: 약 39분
MTP 사용 시 (최신 master 포크):
- PP: 600 tok/s (42% 감소)
- TG: 50 tok/s (85% 증가)
- 85k 토큰 완료까지 걸린 총 시간: 약 23분 (1.7배 빠름, 41% 단축)
41%의 시간 절감은 꽤 엄청난 거니까, PP 작업이 주력이 아니라면 MTP를 한번 써보는 걸 추천해! 난 듀얼 에이전트 셋업으로 돌리고 있어서, 메인 에이전트의 작업을 검토하는 비평 에이전트까지 고려하면 전체 처리 시간은 더 단축될 수도 있어.


