NVIDIA, 30B/23B/12B 추론 모델을 하나의 체크포인트에 담은 'Star Elastic' 공개
NVIDIA AI Releases Star Elastic: One Checkpoint that Contains 30B, 23B, and 12B Reasoning Models with Zero-Shot Slicing
핵심 요약
하나의 체크포인트로 30B, 23B, 12B 모델을 자유롭게 전환하며 추론 효율을 극대화하는 NVIDIA의 새로운 기술.
- 단일 체크포인트 — 30B, 23B, 12B 모델이 하나의 파일에 포함되어 제로샷 슬라이싱을 지원함.
- 지능형 라우터 — Gumbel-Softmax 기반 라우터가 파라미터 예산에 맞춰 최적의 모델 구성을 학습함.
- 단계별 추론 — 사고 단계에는 23B, 최종 답변에는 30B를 사용하여 정확도와 속도를 동시에 확보함.
- 하드웨어 효율성 — 작은 모델을 활용해 메모리 제약이 있는 환경에서도 고성능 추론이 가능함.
다른 서브레딧에서 보고 여기엔 안 올라온 것 같아서 가져왔어. 진짜 대박인 것 같고 로컬에서 충분히 돌릴 수 있을 듯. 11일 전에 나온 것 같은데 내 피드 상단에는 한 번도 안 떠서(피드 확인을 너무 자주 하는데도 말이야) 다시 올림.
내 생각:
이걸 스케일러블 비디오 코딩이라고 생각해 봐. UHD 스트림이 있는데 레이어를 좀 걷어내면 HD나 SD 스트림이 되는 거랑 같아. 여러 파일이 아니라 하나의 파일 스트림인 거지.
3개의 서로 다른 모델이 아니라 중첩된 모델 같아. KV 캐시를 공유할 수 있어서 모델이 슬라이딩 스케일처럼 속도를 조절할 수 있어. 30B 모델로 아이디어를 잡고, 12B 모델로 7000t/s 속도로 추론을 쏟아내서 몇 초 만에 추론 책 한 권을 만든 다음, 다시 30B로 올려서 뭐가 좋은지 평가하는 식이지. 30B가 작은 모델들을 왔다 갔다 하면서 가이드하게 할 수도 있을 거야.
Dense랑 MoE의 하이브리드 같은 느낌도 들어. MoE랑 비슷한데 러시아 인형처럼 3개의 Dense 모델이 들어있는 거지.
원문:
NVIDIA가 방금 Star Elastic을 출시했어. 추론 전략만으로도 이해할 가치가 충분해.
기술적인 측면에서 흥미로운 점은 이거야:
- 하나의 체크포인트. 세 개의 모델.
Star Elastic은 Nemotron Nano v3에 사후 학습 방식을 적용해서 23B와 12B 서브모델을 30B 부모 체크포인트에서 제로샷으로 추출할 수 있게 했어. 세 모델 모두 BF16, FP8, NVFP4 형식의 단일 체크포인트에 들어있어.
- 라우터가 가중치뿐만 아니라 아키텍처도 학습함.
Gumbel-Softmax로 학습된 라우터가 어텐션 헤드, Mamba SSM 헤드, MoE 전문가, FFN 채널, 임베딩 차원 등 모든 탄력적 축에 걸쳐 목표 파라미터 예산에 맞는 최적의 중첩 구성을 매핑해. 이런 구성 요소들의 중요도 기반 순위는 학습 시작 전에 계산돼.
- 생각할 땐 작은 모델, 답변할 땐 전체 모델 사용.
이게 우리가 가장 흥미롭게 본 발견이야. 탄력적 예산 제어는 사고 단계에는 23B 서브모델을, 최종 답변에는 30B 모델을 할당해. 추론 과정은 양은 많지만 낮은 용량에서도 잘 돌아가거든. 최종 답변은 양은 적지만 정밀함이 필요해. 모델 크기를 단계별 복잡도에 맞추면:
→ 표준 예산 제어 대비 정확도 +16%
→ 지연 시간 1.9배 감소
AIME-2025, GPQA, LiveCodeBench v5, MMLU-Pro에서 측정된 결과야.
- 비용 절감 효과가 상당함.
→ 각 버전을 처음부터 사전 학습하는 것 대비 토큰 360배 감소
→ 최신 순차 압축 기술 대비 토큰 7배 감소
→ 23B와 12B 중첩 모델은 독립적으로 학습된 비슷한 크기의 베이스라인과 같거나 더 나은 성능을 보여줌
- 하드웨어 접근성.
12B NVFP4 버전은 BF16 구성이 메모리 부족으로 안 돌아가는 RTX 5080에서도 돌아가. RTX Pro 6000에서는 30B BF16 베이스라인의 3.4배인 7,426 tokens/s에 도달해.
상세 분석과 단계별 코드 가이드는 여기서 확인해: https://www.marktechpost.com/2026/05/09/nvidia-ai-releases-star-elastic-one-checkpoint-that-contains-30b-23b-and-12b-reasoning-models-with-zero-shot-slicing/
