GLM5.3 Flash용 'Strata' 출시! Project Maya
"Strata" for GLM5.3 Flash is here for some! Project Maya
핵심 요약
개인 하드웨어에서 대규모 모델인 GLM-5.3-Flash를 효율적으로 구동하게 해주는 Project Maya가 공개되었습니다.
- 모델 최적화 — GPU, RAM, SSD를 활용해 321B 파라미터 모델을 개인 PC에서 구동함
- 성능 향상 — 하드웨어 사양에 맞춰 모델을 튜닝하여 실사용 가능한 토큰 속도를 제공함
- 호환성 지원 — OpenAI 및 Anthropic API와 호환되며 도구 호출 기능을 지원함
- 실제 사용자 반응 — 하드웨어 사양에 따라 속도 차이가 크며 일부는 성능 최적화에 만족함
glm5.3 flash 돌리는데 10tok/s밖에 안 나와서 사실상 못 써먹을 수준이라 빡쳐있던 차에 이거 발견함. Maya 쓰니까 이제 30 tok/s 나오네. GLM5.3은 이렇게 낮은 양자화 상태인데도 지금까지 써본 qwen 3.8 flash보다 훨씬 쓸만함. 아직 테스트 중이긴 한데.
이거 진짜 대박이다. 이제 GLM5.3 flash 돌릴 수 있는 사람 많아지겠네.
https://github.com/mw00/project-maya
Project Maya
https://github.com/mw00/project-maya#project-maya
내 GPU에서 직접 돌리는 3210억 파라미터 AI 모델
GLM-5.3-Flash, 개인용으로 빠르고 안전하게 · NVIDIA GPU 1개부터 최대 16개까지 · AMD 및 Windows 지원(실험적) · 채팅, 이미지 생성, OpenAI 및 Anthropic 호환 API
이 정도 사이즈 모델은 보통 데이터센터급 장비가 필요한데, Maya는 네가 가진 하드웨어에서 GLM-5.3-Flash(zai-org, MIT 라이선스)를 바로 돌려줌. 3210억 파라미터에 토큰당 활성 파라미터는 약 180억 개, 컨텍스트는 최대 100만 토큰까지 지원함. 엔진 자체가 이 모델 하나만을 위해 설계됐거든. 대화에 자주 쓰이는 전문가 모델은 GPU에 올리고, 그다음은 RAM, 나머지는 NVMe SSD에 둔 다음 채팅할 때마다 알아서 옮겨줌. 지가 알아서 GPU, CPU, RAM, SSD 성능 측정해서 최적화까지 다 해버림. 데이터 유출 걱정? 전혀 없음.
-
개빠름: RTX 4090 4개 꽂으면 최대 118 tok/s, RTX 5090 하나만 써도 30 tok/s 넘게 나옴. 아래에 실제 유저들이 뽑은 실측 데이터 있음.
-
원본이랑 거의 똑같음: Maya 자체 양자화 기술로 FP8 모델 제로샷 정확도의 97.7~99.2%를 그대로 유지함.
-
기존 툴이랑 호환: OpenAI, Anthropic 호환 API에 툴 콜 기능까지 다 돼서 코딩 에이전트 바로 붙여 쓰면 됨.
-
올인원: 브라우저에서 바로 쓰는 채팅이랑 실시간 모니터링, 이미지 생성, 사고 과정(thinking) 기능까지, 명령어 한 줄이면 설치 끝.
