Muse Glimmer, RTX 3090 한 장에 진짜로 들어감
Muse Glimmer ACTUALLY fits on a single RTX 3090
핵심 요약
Muse Glimmer 모델이 RTX 3090에서 넉넉한 컨텍스트와 함께 원활하게 구동됨을 확인한 테스트 결과 공유.
- 성능 테스트 — RTX 3090에서 Muse Glimmer가 Qwen이나 Gemma보다 훨씬 효율적으로 구동됨
- 메모리 효율 — 22~23GB VRAM 사용으로 3090에서 여유로운 컨텍스트 확보 가능
- 속도 및 정확도 — 초당 64~124 토큰의 속도와 150k 토큰 니들 테스트 완벽 통과
- 모델 비교 — Qwen3.6-27B 대비 컨텍스트 활용 면에서 압도적인 우위 점함
오늘 아침에 테스트 좀 해봤는데, Muse Glimmer가 Qwen3.6-27B나 Gemma-4-31B랑 다르게 Q4_K_XL에서 풀 컨텍스트 + DFlash + mmproj를 돌려도 RTX 3090 한 장에 아주 널널하게 들어가서 깜짝 놀랐다.
Unsloth 말로는 Muse Glimmer가 256k 컨텍스트까지 지원한다더라. 내가 쓴 명령어는 이거임:
llama-server \
--model Muse-Glimmer-30B-UD-Q4_K_XL.gguf \
--mmproj Muse-Glimmer-30B-mmproj-kquant.gguf \
--spec-draft-model Muse-Glimmer-30B-DFlash-kquant.gguf \
--spec-draft-ngl 999 \
--spec-draft-n-max 15 \
--spec-type draft-dflash \
-c 262144 \
--override-kv muse-glimmer.context_length=int:262144,dflash.context_length=int:262144 \
-ngl 999 \
-fit off \
--parallel 1 \
--flash-attn on \
--no-warmup \
--cache-type-k f16 \
--cache-type-v f16 \
--temp 1.0 \
--top-p 0.95 \
--top-k 64 \
--reasoning-preserve \
--jinja \
--host 127.0.0.1 \
--port 8080
이게 VRAM 22GB에서 23GB 정도 먹는데, 실제로 써보면 메모리도 꽤 남음.
RTX 3090에서 Qwen3.6-27B랑 Gemma-4-31B 돌릴 때는 MTP + mmproj 써서 Q4_K_XL 모델로 겨우겨우 돌렸는데, VRAM 한계치까지 꽉 채워서 나온 결과가 이거임:
| Model | F16 KV cache | Q8 KV cache |
|---|---|---|
| Qwen3.6-27B | 70,000 tokens | 125,000 tokens |
| Gemma-4-31B | 52,000 tokens | 81,000 tokens |
저렇게 컨텍스트 짧게 잡으면 f16에서는 거의 못 써먹을 수준이라, 진짜 어쩔 수 없는 상황 아니면 Q8 KV는 안 쓰거든. 그래서 보통은 느려터진 DGX Spark로 풀 컨텍스트 돌리는 편이었음.
근데 Muse Glimmer는 RTX 3090에 너무 깔끔하게 들어가니까 굳이 DGX Spark 쓸 이유가 없네. 그냥 Spark로는 풀 KV 띄워놓고 에이전트 여러 개 병렬로 돌리는 게 나을 듯.
테스트해보니까 Muse Glimmer는 DFlash 환경에서 출력하는 게 산문이냐 코드냐에 따라 초당 64토큰에서 124토큰 정도 나오더라. 어느 쪽이든 속도 꽤 준수함. 프롬프트 처리 속도는 초당 1400토큰 정도 찍혔음.
150k 토큰 정도에서 니들 헤이스택(needle haystack) 테스트도 두 개 돌려봤는데, 하나는 맨 앞에, 하나는 맨 뒤에 박아놨거든. 근데 모델이 한 번에 완벽하게 찾아내더라. 그러니까 이거 128k 컨텍스트 소프트 캡 걸려있는 거 절대 아님.


