스케일링 법칙에 대한 고찰 - Z.ai
Thoughts About Scaling Law - Z.ai
핵심 요약
모델 성능 향상을 위해 파라미터 수뿐만 아니라 학습 데이터, 추론 비용, 포스트 트레이닝 등 다양한 요소를 최적화해야 한다는 분석입니다.
- 스케일링 법칙 변화 — 파라미터 수보다 학습 데이터와 추론 효율성이 중요해짐
- 포스트 트레이닝 효과 — GLM-5.3 실험을 통해 모델 구조 변경 없이도 성능 향상 입증
- 추론 비용 최적화 — 모델 크기를 줄이고 학습량을 늘리는 방식이 비용 효율적임
- MoE 모델의 특성 — 활성화된 파라미터와 깊이가 추론 능력에 핵심적인 역할을 함
스케일링 법칙에 대한 생각
스케일링, 단순히 파라미터만 늘리는 게 다가 아니다. 요즘 모델 하나 나올 때마다 다들 똑같은 질문만 던진다. "파라미터 몇 개임?" 근데 이건 단독으로 답할 수 있는 질문이 아님. 파라미터 수는 데이터가 얼마나 있는지, 연산 자원을 어디에 쏟을 건지, 누가 어떤 환경에서 모델을 돌릴 건지, 이 세 가지랑 같이 봐야 의미가 있거든.
이 바닥도 뼈저리게 겪으면서 배운 거다. Kaplan 등(2020)은 데이터보다 파라미터를 더 빨리 늘려야 한다는 식의 지수를 내놨고(대략 2.7:1), 업계는 그대로 따라갔지. GPT-3, Gopher, MT-NLG가 다 그랬음. 그러다 Hoffmann 등(2022)이 모델 400개를 다시 돌려보니까, 연산 효율 최적점은 파라미터당 토큰 20개 정도였고, 연산 자원이 충분하면 둘 다 똑같은 비율로 늘려야지 하나만 튀면 안 된다는 걸 밝혀냄. 예전 모델들은 연산 자원 규모가 커질수록 오차가 눈덩이처럼 불어났고, 그래서 그 세대의 가장 큰 모델들이 가장 비효율적으로 만들어졌던 거임. 돌이켜보면 1조 파라미터 시대는 업계 전체가 다 같이 헛발질하다가 돌아온 꼴이지.
Chinchilla가 끝도 아니었음. 걔는 딱 한 번 학습하고 평가받는 모델을 기준으로 연산 자원을 최적화한 거니까. 요즘은 모델 하나를 하루에도 수십억 번씩 호출하는데, 결국 평생 비용은 추론에서 다 나감. 추론을 목적 함수에 넣으면 최적점은 훨씬 더 오래 학습시킨 작은 모델로 이동함. Llama-2-7B나 Gemma-2-9B가 파라미터당 토큰 290개, 889개씩 때려 박으면서 했던 '의도적인 과잉 학습'이 바로 그거임.
희소성(Sparsity)은 또 판을 바꿨지. MoE 모델에서는 두 가지 수치를 따로 봐야 함. 전체 파라미터는 모델이 얼마나 많은 지식, 사실, 잡다한 정보를 담을 수 있는지를 결정하고, 활성화된 파라미터와 유효 깊이(effective depth)는 모델이 얼마나 깊게 생각할 수 있는지, 논리적 추론을 어디까지 안 끊기고 이어갈 수 있는지를 결정함. 20:1 같은 밀집 모델 비율은 여기 안 통함. 심지어 그 비율도 고정된 게 아님. Roberts 등(2025) 연구 보면 파라미터당 토큰 최적값은 작업마다 다름. 암기는 파라미터가 많을수록 유리하고, 추론은 데이터가 많을수록 유리하거든. MoE 후속 연구를 봐도 파라미터당 토큰 수를 고정했을 때 전체 파라미터만 늘리면 오히려 추론 성능이 떨어지고, 전문가(expert)를 더 많이 활성화하는 게 확실히 도움 됨.
이게 우리가 뭘 만들고 있는지랑 직결되는 문제임. 취약점 찾는 건 단순히 데이터 꺼내오는 문제가 아니거든. CVE 몇 개 더 외웠다고 해결되는 게 아님. 20단계짜리 추론 과정을 끝까지 논리 안 놓치고 끌고 가는 게 핵심이지. 그 능력은 전체 파라미터 수에서 나오는 게 아님.
그래서 이번 릴리즈가 나온 거임. 전체 파라미터도 어느 정도 임계점까지는 중요함. 세상을 담을 만큼은 커야 하니까. 근데 그 다음부터는 다른 데서 스케일링을 해야 함. 포워드 패스당 유효 깊이, 그리고 무엇보다 중요한 건 포스트 트레이닝(post-training)임. GLM-5.3은 이 가설을 검증하려고 만든 실험체임. 베이스 모델, 아키텍처, 전체 파라미터, 활성화 파라미터 다 GLM-5.2랑 똑같음. 딱 한 달 동안 장기 환경이랑 RL(강화학습) 스케일링만 돌렸음. 성능 향상? 무시할 수준 아님. 뭐, 스케일링 다이얼은 하나가 아니니까. 이번엔 포스트 트레이닝 다이얼을 돌렸음. 다른 건 다 끝났다는 게 아니라, 이게 제일 여유가 많았거든. 베이스 모델 크기, 사전 학습 데이터, 포워드 패스당 연산량, 이런 건 아직 다 남아있고 나중에 하나씩 다 건드릴 거임. 이번 실험으로 배운 건 다이얼을 꼭 다 같이 돌릴 필요는 없다는 거, 그리고 다음에 돌려야 할 다이얼은 보통 저번에 돌렸던 게 아니라는 거임. 스케일링은 아직 안 끝났음. 다음엔 미드 트레이닝, 프리 트레이닝, 아니면 또 다른 거 들고 오겠지.
Tweet : https://xcancel.com/jietang/status/2089941544581403107#m



