[메가스레드] GLM-5.3-Flash - 구 ox-alpha
[Megathread] GLM-5.3-Flash - former ox-alpha
핵심 요약
GLM-5.3-Flash 모델 출시와 관련하여 아키텍처, 벤치마크, 추론 설정 등을 다루는 메가스레드입니다.
- 모델 아키텍처 — 하이브리드 Sparse+Linear Attention 및 320B 파라미터 적용
- 멀티모달 기능 — 24레이어 ViT를 통한 이미지 및 비디오 토큰 처리 지원
- 추론 최적화 — vLLM, SGLang 등 다양한 엔진 및 FP8 가중치 지원
- 출시 정보 — MIT 라이선스로 공개된 GLM-5 시리즈의 첫 멀티모달 모델
GLM-5.3-Flash 출시 관련 통합 스레드다.
-
양자화(Quants)
-
파인튜닝 및 검열 해제(Fine-Tunes & Abliterations)
-
채팅 템플릿(Chat Templates)
-
추론 서버 지원 및 설정(Inference Server Support & Configuration)
-
사용 후기, 벤치마크 및 모델 비교(Experiences, Benchmarks & Model Comparisons)
앞으로 올라올 중복 글들은 정리해서 이쪽으로 모아둘 예정이니 참고해라.
주요 특징
GLM-5.3-Flash는 GLM-5 시리즈 중 최초로 멀티모달을 기본 지원하는 모델이자, glm5_next 아키텍처를 적용해 공개한 첫 번째 오픈 웨이트 모델이다. Z.ai 측 주장에 따르면, GLM-5.2보다 가격은 1/10 수준인데 성능은 더 좋고, 코딩이나 에이전트 벤치마크에서는 Claude Opus 4.8에 근접한다고 한다. 주요 변경점은 다음과 같다.
-
하이브리드 Sparse + Linear Attention: 45개 레이어가 3개의 KDA 선형 어텐션 블록 뒤에 1개의 DeepSeek 스타일 Sparse 어텐션이 오는 구조로 반복됨(선형 34개 / Sparse 11개 레이어). Sparse 레이어는 라이트닝 인덱서(32헤드, 차원 128)를 사용하고 top-k 예산은 2048 토큰으로 설정해서 긴 문맥 처리 비용을 확 줄였다.
-
Manifold-Constrained Hyper-Connections (mHC): 레이어 간 매니폴드 제약 혼합을 적용해 잔차 스트림을 넓혔고, 이를 통해 스케일링 효율을 더 끌어올렸다.
-
네이티브 멀티모달: 24레이어 ViT(448px, 패치 14, 2x2 공간 병합)에 시간적 패칭을 더해서 이미지랑 비디오 토큰을 보캐불러리에 바로 때려 박았다. 30T 토큰 규모의 멀티모달 코퍼스로 학습됨.
-
MTP 헤드 포함: 다음 N개 토큰 예측 레이어 1개가 웨이트에 포함되어 있음. 공식 vLLM 레시피는 이걸 사용해서 5개의 추론 토큰을 생성한다.
-
FP8 우선: 메인 레포는 FP8(e4m3, 동적 활성화 스케일링) 기준이다. 별도의 공식 BF16 레포도 따로 있다.
모델 개요
-
비전 인코더가 포함된 인과 언어 모델()


