GLM-5.2는 로컬 AI의 승리다
GLM-5.2 is a win for local AI
핵심 요약
거대 모델 GLM-5.2의 등장으로 로컬 AI 환경의 발전과 향후 소형 모델로의 증류 가능성에 대한 기대감이 커지고 있습니다.
- 모델 성능 — 753B 파라미터의 강력한 추론 능력과 1M 컨텍스트 윈도우 지원
- 하드웨어 요구사항 — 로컬 구동을 위해 최소 176GB 이상의 VRAM 및 고성능 장비 필요
- 증류 기대감 — 8B/70B 모델로의 증류를 통해 로컬 환경의 성능 향상 예상
- 실제 구동 경험 — 고사양 Mac Studio 환경에서 구동 가능 여부와 속도에 대한 사용자 간 의견 공유
GLM 5.2가 753B라는 거대한 덩치를 자랑해서 엔터프라이즈급 클러스터 없이는 집에서 돌릴 엄두도 못 낸다는 건 알지만, MIT 라이선스로 풀린 진짜 최상위권 코딩 에이전트가 세상에 나왔다는 게 참 희망적이네. 증류(distillation) 잠재력이 엄청나거든. 커뮤니티에서 GLM 5.2의 추론 능력과 합성 데이터셋을 활용해 8B나 70B 같은 작은 모델들을 파인튜닝하기 시작하면, 앞으로 몇 달 안에 우리가 매일 쓰는 로컬 환경도 엄청나게 좋아질 거야.
수정: 로컬 하드웨어에서 돌릴 수 있다는 사람이 이렇게 많을 줄은 몰랐네. 데이터 사양은 여기 있어:
| Quantization Level | Memory Required | Minimum Hardware Setup |
|---|---|---|
| FP8 Weights | 744 GB to 890 GB | 8x H200 (141GB) or 8x H100 (80GB) server node |
| 4-bit (Q4_K_M) | 476 GB to 500 GB | Mac Studio cluster or 6x 80GB enterprise GPUs |
| 2-bit (Q2_K_XL) | 241 GB to 280 GB | Single 256GB Mac Studio (Ultra) or RTX 4090 + 256GB system RAM |
| 1-bit Dynamic | 176 GB to 180 GB | 192GB Mac Studio or 24GB GPU + 192GB system RAM |
모델 및 데이터셋 정보
- 사전 학습 데이터: 28.5조 개의 토큰으로 학습됨.
- 아키텍처 규모: 총 753B 파라미터, 추론 시 토큰당 약 40B 파라미터 활성화.
- 컨텍스트 용량: 1,000,000 토큰 컨텍스트 윈도우를 기본 지원하며, 응답당 최대 131,072 출력 토큰 지원.
KV 캐시 VRAM 스케일링 (100k / 1M 토큰당)
1M 컨텍스트 윈도우를 제대로 쓰려면 KV 캐시용으로만 VRAM을 엄청나게 잡아먹어. 이 스케일링은 캐시 양자화 방식에 따라 완전히 달라져:
- 16-bit (FP16/BF16): 100k 토큰당 15–20 GB 추가 (전체 1M 컨텍스트 사용 시 약 150–200 GB 추가).
- 8-bit (FP8/INT8): 100k 토큰당 7.5–10 GB 추가 (전체 1M 컨텍스트 사용 시 약 75–100 GB 추가). 정확도와 메모리 사이에서 적절한 타협점임.
- 4-bit (INT4): 100k 토큰당 3.5–5 GB 추가 (전체 1M 컨텍스트 사용 시 약 35–50 GB 추가). 메모리 요구량은 확 줄어들지만, 긴 문맥을 읽어올 때 정확도가 떨어질 수 있음.
참고: 이 정보는 온라인에서 긁어온 거라 추정치일 뿐이야. 투명하게 밝히자면, 표 만들고 데이터 정리하는 건 AI 도움 좀 받았어. 내가 일일이 포맷 맞출 인내심이 없어서... 나도 사람인지라 어쩔 수 없네!


