Muse Glimmer 공개: 상시 로컬 에이전트 워크플로우에 최적화된 오픈 웨이트 모델
Introducing Muse Glimmer: an open-weight model optimized for always-on local agent workflows
핵심 요약
Meta가 로컬 에이전트 작업에 최적화된 30B 파라미터의 멀티모달 오픈 웨이트 모델 'Muse Glimmer'를 공개했습니다.
- 모델 사양 — 30B 파라미터의 멀티모달 모델로 100개 이상의 언어 학습 및 추론 효율 조절 가능함
- 메모리 최적화 — 4비트 양자화를 통해 20GB 미만으로 구동되어 소비자용 하드웨어에서 실행 가능함
- 에이전트 기능 — 복잡한 작업 완수, 함수 호출, 다단계 추론 및 실패 복구 기능 탑재됨
- 생태계 지원 — Hugging Face에 공개되었으며 주요 로컬 LLM 도구 및 하드웨어 최적화 예정임
안녕 r/LocalLLaMA 형들 👋
오늘 로컬 에이전트 워크플로우에 특화된 30B 오픈 웨이트 모델인 Muse Glimmer를 공개하게 됐어. Apache 2.0 라이선스로 풀었으니까 마음껏 가져다 써.
주요 사양
- 30B 파라미터, 덴스 모델
- 멀티모달: 전용 인식 인코더를 통한 텍스트 + 이미지 인터리브 지원
- 100개 이상의 언어 학습 완료
- 추론 강도 조절 가능 (품질/속도 트레이드오프)
메모리 점유율
풀 정밀도 상태에선 30B 모델 돌리려면 55GB 넘게 필요한데, 이건 일반 소비자용 하드웨어에선 무리지. 그래서 웨이트를 4비트 정도로 양자화해서 LM을 20GB 미만으로 줄였어. 이러면 24GB나 32GB VRAM 환경에서도 KV 캐시, 인식 인코더, 그리고 추측 디코딩(speculative decoding)용 드래프터까지 동시에 돌릴 여유가 생겨. 압축해도 에이전트 작업 성능 저하는 거의 없으니까 걱정 마.
추측 디코딩 (Speculative decoding)
경량 DFlash 기반 드래프터가 포함돼 있어. 얘가 토큰 덩어리를 제안하면 메인 모델이 병렬로 검증하는 방식이야. 토큰 하나씩 생성하는 것보다 훨씬 빠르면서 결과물 품질은 똑같아. 메모리 부담 줄이려고 양자화된 드래프터 버전도 같이 제공해.
주요 기능
Muse Glimmer는 에이전트 루프 작업에 최적화해서 학습시켰어:
- 엔드 투 엔드 작업 완료 (DeepSearch QA, MCP-Atlas, 𝛕3-Bench, SWE-Bench 등에서 강력한 성능)
- 긴 워크플로우 전반에 걸친 정밀한 스키마 기반 함수 호출
- 장기적인 다단계 추론
- 실패 복구 — 툴 호출이 실패하거나 예상치 못한 결과가 나와도 멈추지 않고 스스로 진단해서 재시도하도록 학습시켰어. 이건 이번 학습의 핵심 목표였음.
- OpenClaw 및 기타 에이전트 스캐폴드와 호환
- 멀티모달 이해 및 추론
실행 방법
웨이트는 허깅페이스에 올라와 있어. Ollama, LM Studio, Unsloth, torchtitan도 곧 지원할 예정이고, llama.cpp, MLX, ExecuTorch 최적화 통합도 준비 중이야. 서빙은 vLLM이랑 SGLang 쓰면 돼. Together AI, Fireworks AI, OpenRouter에서 바로 써볼 수도 있어. AMD, Arm, Dell, Intel, NVIDIA랑 협력해서 기기별 최적화도 진행 중이니까 기대해.
형들의 피드백 기다릴게. Muse Glimmer로 다들 뭐 만들지 진짜 궁금하다.
🔗 웨이트: https://huggingface.co/meta-models 🔗 리서치 블로그: 🔗 리소스:


