Nemotron-3-Super-120B-A12B (하이브리드 Mamba+MoE), 4×3090에서 504K 토큰까지 완벽한 니들 리트리벌 성능 입증
Nemotron-3-Super-120B-A12B (hybrid Mamba+MoE) holds perfect needle retrieval to 504K tokens on 4×3090
핵심 요약
4개의 3090 GPU를 사용하여 Mamba+MoE 하이브리드 모델인 Nemotron-3-Super-120B로 504K 토큰까지 완벽한 니들 리트리벌을 구현함.
- 하이브리드 아키텍처 — Mamba와 MoE를 결합하여 긴 컨텍스트에서도 효율적인 디코딩 속도를 유지함.
- 니들 리트리벌 — 504K 토큰까지 모든 깊이에서 데이터 누락 없이 정확한 검색 성능을 보임.
- 하드웨어 구성 — 4개의 3090 GPU 환경에서 71GB 모델을 구동하여 로컬 환경에서 긴 컨텍스트를 처리함.
- 시스템 한계 — 긴 컨텍스트 내에서 최신 지시사항이 우선되는 최신성 편향이 존재함.
TLDR: Mamba/SSM 레이어는 커지는 KV 캐시 대신 고정 크기의 순환 상태를 유지하므로 컨텍스트 비용이 거의 없음. 50만 토큰에서 전체 니들 리트리벌을 GPU에서 수행, 약 71GB. 새로운 imatrix gguf는 여기: https://huggingface.co/mradermacher/NVIDIA-Nemotron-3-Super-120B-A12B-BF16-i1-GGUF/resolve/main/NVIDIA-Nemotron-3-Super-120B-A12B-BF16.i1-Q4_K_S.gguf
솔로 설정, 로컬 전용. NVIDIA의 Nemotron-3-Super(nemotron_h: 하이브리드 Mamba2 + 주기적 어텐션 + MoE, A12B 활성, 1M 컨텍스트 학습)를 mradermacher의 i1-Q4_K_S(71GB)로 가져와 4×3090에서 실행함.
수치 (llama.cpp-latest, i1-Q4_K_S, 전체 GPU 상주, q8_0 KV)
디코드 (t/s): 72tg 짧음 · 67tg 30K · 51tg 96K · 47tg 126K · 39tg 200K · 34tg 269K · 23tg 504K
프리필 (t/s): ~2080pp 30K · 1469pp 200K · 885pp 504K
니들 인 헤이스택(10/50/90% 깊이에 코드 삽입): 504,482 토큰까지 테스트한 모든 깊이에서 정확한 리콜. 누락 없음.
VRAM: 카드당 ~20GB
풀 어텐션 모델은 컨텍스트가 커질수록 증가하는 KV 캐시 비용을 지불해야 하므로 채워질수록 디코딩 속도가 급락함. Nemotron의 Mamba 레이어는 고정 크기 상태를 유지함 — 소수의 어텐션 레이어만 KV를 가짐(2개의 KV 헤드, 매우 작음). 결론: 500K에서의 디코드(23 t/s)는 동일한 박스/엔진에서 유사한 풀 어텐션 MoE(MiniMax-M2.7-REAP, 동일하게 ~74GB, A10B)가 30K에서 실행되던 속도(24.5 t/s)와 비슷함. 동일 박스 비교: Nemotron은 30K 기준에서 약 2.7배의 디코드 속도를 보였고 500K까지 정밀도를 유지함.
묻혀 있는 기존 지시사항은 나중에 나오는 상충되는 지시사항에 밀림(최신성 편향) — 상단에 배치한 "고정 계약"이 마지막에 반대되는 내용을 넣자 뒤집힘. 중요한 규칙은 긴 본문 속에 묻지 말고 끝부분이나 시스템 프롬프트에 넣을 것.

