모델 해킹을 통해 GH200 시스템에서 GLM5.2 속도를 2.5 tok/s에서 50 tok/s 이상으로 끌어올렸습니다.
I did some model hacks, and got GLM5.2 from about 2.5 tok/s to >50 tok/s on my GH200 system.
핵심 요약
고성능 GH200 시스템에서 모델 가중치 병합과 vLLM 패치를 통해 GLM5.2의 추론 속도를 20배 이상 개선했습니다.
- 시스템 사양 — 듀얼 Hopper H100 GPU와 960GB 메모리를 갖춘 강력한 환경임
- 성능 최적화 — MTP 헤드와 AWQ 양자화 버전을 병합하여 추론 속도를 대폭 향상함
- vLLM 패치 — 모델 변경 사항을 적용하기 위해 vLLM 엔진을 수정함
- 추론 속도 — 4x 동시성 기준 약 55 tok/sec, 단일 추론 시 약 45 tok/sec 달성함
dnhkng.github.io
원문 사이트로 이동
G'day.
이건 내 로컬 LLM 모험의 3번째 파트야. 난 미친 시스템을 하나 가지고 있지. 서버를 데스크톱으로 개조한 시스템이야:
| Component | Spec |
| --- | --- |
| GPUs | 2x Hopper H100, 96 GB HBM3 each |
| CPUs | 2x Grace, 72 cores each |
| Host memory | 480 GB LPDDR5X per Grace, 960 GB total |
그래서 기술적으로는 GLM5.2를 돌릴 수 있어. vLLM에서 기본 설정으로 돌렸을 때 2.5 tok/second 정도로 형편없었다는 점만 빼면 말이지.
NUMA 설정을 건드려서 속도를 좀 높였지만, 결국 수술이 좀 필요했어. 오피스 zai의 GLM-5.2-FP8 레포에서 MTP 헤드를 가져와서 CyanKiwi의 AWQ 양자화 버전 본체에 이식했지.
이 지침을 사용하면 너도 똑같이 할 수 있어. CyanKiwi의 가중치를 전부 받아야 하지만, zai 레포에서는 몇 개의 파일만 가져오면 돼. 스크립트가 둘을 병합해 줄 거야. 그리고 변경 사항을 처리하려면 vLLM도 패치해야 해.
이렇게 해서 4x 동시성 기준 최고 약 55 tok/sec, 단일 추론 시 약 45 tok/sec까지 속도를 올렸어. RAM에서 VRAM으로 스트리밍하는 방식이야. 도움이 되길 바라!

