소비자용 하드웨어에서 돌려본 GLM 5.2
GLM 5.2 on consumer hardware
핵심 요약
고성능 소비자용 하드웨어에서 GLM 5.2 모델을 구동한 후기와 성능에 대한 사용자들의 토론.
- 하드웨어 사양 — Threadripper Pro 9975 WX와 RTX 5090 듀얼 구성으로 테스트함.
- 성능 결과 — llama.cpp를 사용하여 초당 12토큰의 생성 속도를 기록함.
- 프롬프트 처리 — llama.cpp의 느린 프롬프트 처리 속도가 주요 쟁점으로 지적됨.
- 하드웨어 정의 — 소비자용 하드웨어의 범위를 두고 사용자들 간의 의견이 갈림.
GLM 5.2의 unsloth 양자화 버전을 여전히 "소비자용에 가까운" 하드웨어에서 테스트해 봤습니다:
32코어 Zen5 Threadripper Pro 9975 WX, Asus WRX90E-SAGE-SE PCIe Gen5, 512GB DDR5 ECC RAM @ 4800MHz, RTX 5090 듀얼 구성입니다.
이 기기는 RAM 대란 이전에 조립한 것이라, 요즘의 터무니없는 가격에 비하면 그때는 그렇게까지 비싸지 않았습니다.
사용한 양자화 모델은 unsloth/GLM-5.2-GGUF, UD-Q5_K_S (가중치 492GB)입니다.
새로 컴파일한(cmake -B build -DGGML_CUDA=ON -DCMAKE_CUDA_ARCHITECTURES="120f" -DGGML_CUDA_FA_ALL_QUANTS=ON -DGGML_CUDA_FORCE_MMQ=ON -DGGML_SCHED_MAX_COPIES=1 -DGGML_CUDA_GRAPHS=ON -DGGML_CCACHE=OFF -DGGML_CUDA_ENABLE_UNIFIED_MEMORY=0; cmake --build build --config Release -j 64) llama.cpp를 사용했고, 다음 명령어로 실행했습니다:
CUDA_VISIBLE_DEVICES=0,1 numactl --physcpubind=0-31 --localalloc llama.cpp/build/bin/llama-server \
--model ./GLM-5.2-UD-Q5_K_S-00001-of-00012.gguf \
--temp 1.0 \
--top-p 0.95 \
--min-p 0.01 \
--fit on --no-mmap --flash-attn on --ctx-size 32768 --no-warmup --prio 3 \
--threads 32 --threads-batch 32 --numa isolate --log-verbosity 4 --split-mode layer --direct-io --jinja
이렇게 해서 꾸준히 12t/s가 나옵니다. 에이전트 같은 건 안 쓰고 그냥 채팅만 해봤습니다.
마지막 줄의 llama.cpp 옵션을 생략하거나 사용해도 속도 차이는 거의 없으며, NUMA 관련 설정도 마찬가지입니다.

