GLM 5.2, 로컬 환경에서 어느 정도 속도가 나오나요?
GLM 5.2, what speeds are we getting locally?
핵심 요약
로컬에서 GLM 5.2를 구동하는 사용자들의 하드웨어 사양과 추론 속도를 공유하는 스레드입니다.
- 성능 공유 — 로컬 환경에서의 추론 엔진, 사양, 양자화 방식 및 토큰 속도 공유함
- 고성능 하드웨어 — M3 Ultra 및 다중 RTX 3090 구성 등 고사양 장비 사용 사례 등장
- 기술적 논의 — 디스어그리게이티드 프리필(disaggregated prefill) 및 모델 스트리밍 기술에 대한 심도 있는 대화
- 오픈소스 요청 — 커뮤니티 사용자들은 개발 중인 최적화 도구의 오픈소스를 강력히 희망함
로컬에서 GLM 5.2를 구동할 수 있는 분들은 추론 엔진, 시스템 사양, 양자화, 컨텍스트 크기, 그리고 초당 토큰 수(tokens/sec)를 공유해주실 수 있나요? 좋은 수치가 나오면 후속 질문을 드릴 수도 있습니다. 제가 먼저 시작할게요:
llamma.cpp, 6x RTX 3090, 128 DDR5, i7-13700K, unsloth UD-IQ2_M, 90K context @ Q8_0 KV: 7.8 tokens/sec generation, prompt processing was roughly 40 tokens/sec

