RTX 4090에서 MTP + TurboQuant로 Qwen3.6-27B 구동: 262K 컨텍스트에서 80+ t/s 달성
Got MTP + TurboQuant running — Qwen3.6-27B -- 80+ t/s at 262K context on a single RTX 4090
핵심 요약
RTX 4090 환경에서 MTP와 TurboQuant를 최적화하여 27B 모델의 추론 속도를 80 t/s 이상으로 끌어올림.
- 성능 최적화 — MTP와 TurboQuant 조합으로 27B 모델에서 80 t/s 이상의 추론 속도를 달성함.
- 대규모 컨텍스트 — 262K 컨텍스트 윈도우를 유지하면서도 효율적인 KV 캐시 관리를 구현함.
- 기술 검증 — MTP 헤드 이식과 커널 아키텍처 최적화를 통해 실질적인 속도 향상을 확인함.
- 커뮤니티 피드백 — TBQ의 손실 문제와 하드웨어별 성능 차이에 대한 사용자들의 활발한 논의가 이어짐.
MTP와 TBQ4_0(TurboQuant의 무손실 4.25 bpv KV 캐시)을 Qwen3.6-27B에서 구동하려고 이것저것 만져보고 있습니다.
하루 종일 'vibecoding'을 한 끝에 뭔가 쓸만한 걸 만들어낸 것 같네요. 처음 컴파일했을 때 43 t/s 정도였는데, 최적화 후 80-87 t/s까지 올렸습니다. 여기에 MTP draft acceptance가 73% 정도 추가됩니다.
실행 환경:
- RTX 4090 24GB
- Qwen3.6-27B-Heretic-v2 Q4_K_M (MTP 헤드 이식)
- 262K 컨텍스트, TBQ4_0 KV 캐시, MTP draft 3
- Ubuntu 24.04, CUDA 12.x
전문가는 아니라서 개선의 여지는 많겠지만, 작동은 잘 되고 출력 품질도 괜찮아 보입니다. 혹시 시도해 보거나 제 방식에 문제가 있는지 확인하고 싶은 분들을 위해 포크를 빌드해 두었습니다:
https://github.com/Indras-Mirror/llama.cpp-mtp
커널 아키텍처에 대해 궁금하신 분들을 위해 Deepseek에게 기술적 세부 사항을 정리해달라고 했습니다:
https://indrasmirror.au/blog-mtp-shared-tensors-200k.html

