새로운 Muse-Glimmer-30B SOTA 양자화 모델 - 새로운 라인업이 되길 바라며 :)
New Muse-Glimmer-30B SoTA Quants - hopefully a new lineup :)
핵심 요약
학부생이 직접 개발한 최적화 기법을 적용해 성능을 대폭 개선한 Muse-Glimmer-30B 양자화 모델을 공개함.
- 모델 성능 개선 — 자체 개발한 텐서 매핑 알고리즘으로 기존 양자화 모델 대비 성능 향상함.
- Q8 양자화 효율 — UD-Q8_K_XL보다 크기는 작으면서 BF16에 21% 더 근접한 성능을 보여줌.
- 평가 데이터셋 — 위키텍스트뿐만 아니라 GitHub, OASST, GSM8K 등 다양한 데이터셋으로 검증됨.
- 인턴십 구직 — AI 에이전트 오케스트레이션 및 모델 추론 분야에서 인턴십 기회를 찾고 있음.
안녕하세요 여러분,
저는 한동안 양자화 모델을 만들어왔습니다. 최근에는 하드코어 연구에 몰두하려고 잠시 쉬는 시간을 가졌죠(그동안 첫 EMNLP 논문도 제출했습니다!). 그 과정에서 저는 새로운 논문 준비 중인 트릭부터 정말 끝내주는 텐서 매핑 알고리즘까지, 저만의 작은 양자화 최적화 기술들을 쌓아왔습니다.
새로 출시된 Muse Glimmer 30B(메타가 돌아왔다!)에 그 비법 중 일부를 적용해보고 기존의 OG 모델들과 비교해봤습니다. 솔직히 모든 VRAM 클래스에서 현존하는 어떤 양자화 모델에도 뒤지지 않는다는 사실에 저도 놀랐습니다!
가장 멋진 것 중 하나는 제 Q8 양자화 모델인데, UD-Q8_K_XL보다 작으면서도 BF16에 21% 더 근접합니다.
전체 방법론은 카드에 적어두었습니다. 평가 설정, CI, held-out 슬라이스 등 모든 것이요. 댓글로 질문 주시면 답변해 드리겠습니다.
모델: https://huggingface.co/AaryanK/Muse-Glimmer-30B-GGUF
아직 여력은 더 있었지만 컴퓨팅 크레딧이 다 떨어졌네요 :( 학부 2학년생이라 H100 비용을 자주 쓸 수는 없어서, 제목에 "바라며"라고 적었습니다 :)
저는 AI 에이전트 오케스트레이션 및 모델 추론 분야에서 인턴십을 찾고 있습니다. 제 작업이 여러분의 팀에 관련이 있다고 생각되시면 연락 주세요: linkedin.com/in/theaaryankapoor
조만간 그 비법 중 일부를 설명하는 글을 작성할 계획입니다!
더 나은 추론 환경을 기원합니다!

