Muse Glimmer 1M 컨텍스트 테스트 완료 - 모든 테스트 통과함
I ran Muse Glimmer @ 1M context - All tests passed.
핵심 요약
Muse Glimmer 30B 모델을 YaRN으로 1M 컨텍스트까지 확장하여 성공적으로 테스트한 결과입니다.
- 컨텍스트 확장 — YaRN을 사용하여 131K에서 1M까지 성공적으로 확장함
- 성능 검증 — 832K 토큰 환경에서 니들-인-헤이스택 테스트 3/3 통과
- 기술적 이유 — RoPE가 없는 NoPE 레이어 구조 덕분에 긴 컨텍스트에서 안정적임
- DFlash 활용 — 스펙 디코딩을 통해 대역폭 제한 환경에서 속도 약 3배 향상
안녕 얘들아! Muse Glimmer로 이것저것 재밌는 테스트를 좀 해봤는데, 공유하려고 글 써. 사실 아래 요약은 Muse가 직접 쓴 거야!
2× DGX Spark 클러스터 돌려서 메타가 어제 공개한 Muse Glimmer 30B를 출시 바로 다음 날 바로 올려봤어. YaRN 써서 학습된 131K 컨텍스트를 1M까지 뻥튀기했고, 단계마다 리트리벌(retrieval) 검증도 다 마쳤다. 모델 카드에 적힌 "131,072+"라는 힌트가 진짜라는 걸 확인해서 설정이랑 결과 공유한다.
Setup
- Hardware: 2× NVIDIA DGX Spark (GB10, 128 GB unified each, ~273 GB/s), ConnectX-7 direct link between them
- Engine: llama.cpp master (day-1 muse_glimmer support), built from source with CUDA sm_121 + GGML_RPC
- Model: official
Muse-Glimmer-30B-GGUFK-Quant-Dynamic (~18.3 GiB) + officialmmproj(vision) + official DFlash drafter - Spec decode:
--spec-type draft-dflash --spec-draft-n-max 15(block-diffusion drafter) - Context extension:
--rope-scaling yarn --rope-scale <2/4/8> --yarn-orig-ctx 131072plus--override-kv muse-glimmer.context_length=int:<N>(llama.cpp caps at trained length otherwise) - 맞아, llama.cpp RPC로 Spark 두 대에 나눠서도 돌려봤어. 그냥 클러스터링 하는 게 재밌어서 그런 거지 별 이유는 없음. 이 하드웨어에서 평소에 쓰는 건 공식 vLLM에 올린 DeepSeek-V4-Flash-0731인데, RDMA로 TP=2 잡고 1M 컨텍스트 풀로 돌리는 거라 이게 비교군으로는 딱이지.
Results
Needle-in-haystack (3 needles at 10/50/90% depth):
| Document size | vs training (131K) | Retrieval |
|---|---|---|
| 97K tokens | native | 3/3 |
| 188K tokens | 1.4× | 3/3 |
| 415K tokens | 2.9× | 3/3 |
| 832K tokens | 6.35× (deepest needle ~749K) | 3/3 |
Speed:
- Single Spark: ~10.5 tok/s baseline decode → (~3×, 메타가 5090에서 주장한 3.1배랑 비슷함); prefill ~700 tok/s (짧은 컨텍스트), ~390 tok/s (832K 프롬프트 깊숙한 곳); ×4 concurrent ≈ 57 tok/s aggregate per node


