로컬 환경에서 GLM 5.1 구동: 40tps, 2000+ pp/s
GLM 5.1 Locally: 40tps, 2000+ pp/s
핵심 요약
4개의 RTX 6000 Pro를 활용해 GLM 5.1을 로컬에서 매우 빠른 속도로 구동한 사례를 공유함.
- 하드웨어 성능 — 4개의 RTX 6000 Pro를 활용해 40tps 이상의 추론 속도 달성.
- 최적화 실험 — sglang 패치와 반복적인 실험을 통해 안정적인 구동 환경 구축.
- 성능 지표 — 컨텍스트 깊이에 따른 처리량 및 버스트 처리량 데이터 공개.
- 사용자 경험 — Claude 3.5 Sonnet과 비교해도 손색없는 로컬 LLM 성능 체감.
sglang 패치와 수많은 실험 끝에, 4개의 RTX 6000 Pro(350W 제한)에서 reap-ed nvfp4 버전을 안정적이고 빠르게 구동하는 데 성공했습니다. 성능과 품질 모두 매우 만족스럽습니다. 추론 소프트웨어는 아직 이 카드들에 최적화가 덜 된 상태입니다. 올해 말이나 내년 초쯤이면 이 카드들의 진정한 잠재력이 드러날 것으로 보입니다.
컨텍스트 깊이에 따른 처리량
|Prefilled|PP@4096|TG@512|
|:-|:-|:-|
|0|2229.0|42.03|
|4K|1943.6|41.41|
|16K|1558.9|39.72|
|32K|1234.2|38.19|
|64K|863.5|35.87|
TG Peak (버스트 처리량)
43.00 42.00 40.00 39.00 37.00
opencode를 사용한 전반적인 경험은 Sonnet + Claude Code와 상당히 비슷합니다. 100-200k 세션도 안정적입니다.
이번 주말에는 다양한 동시성(concurrency) 설정을 테스트해 볼 예정입니다.
혹시 이 하드웨어에서 더 나은 성능을 보신 분 계신가요?
PS: 동시성(concurrency) = 2 설정이 아주 잘 작동했습니다. 생성 속도가 평균 65 tps에 도달합니다.

