nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-BF16 · 허깅페이스
nvidia/NVIDIA-Nemotron-Labs-3-Puzzle-75B-A9B-BF16 · Hugging Face
핵심 요약
NVIDIA에서 추론 효율성을 극대화한 75B 규모의 하이브리드 MoE 모델 'Nemotron-Labs-3-Puzzle-75B-A9B'를 공개함.
- 모델 아키텍처 — Mamba, MoE, Attention 레이어가 결합된 하이브리드 구조임.
- 추론 효율성 — 기존 120B 모델 대비 파라미터 수를 줄여 서버 처리량을 2배 향상함.
- 멀티 토큰 예측 — MTP를 지원하여 텍스트 생성 속도를 가속화함.
- 상업적 활용 — 상업적 사용이 가능한 라이선스로 배포됨.
huggingface.co
원문 사이트로 이동
Nemotron-Labs-3-Puzzle-75B-A9B는 NVIDIA가 개발한 배포 최적화 대규모 언어 모델로, Nemotron-3-Super-120B-A12B에서 파생되었습니다. 이 모델은 사후 학습 압축 프레임워크인 Iterative Puzzle을 사용하여 제작되었으며, 강력한 다운스트림 정확도를 유지하면서 대화형, 추론 중심, 긴 컨텍스트 작업의 추론 효율성을 크게 향상하는 것을 목표로 합니다.
이 모델은 Mamba, MoE, Attention 레이어가 교차하는 하이브리드 MoE 아키텍처를 채택했습니다. Nemotron-3-Super와 마찬가지로 더 빠른 텍스트 생성을 위한 멀티 토큰 예측(MTP)을 지원합니다. 이전 모델과 비교하여 Puzzle-75B-A9B는 총 120.7B/활성 12.8B 파라미터에서 총 75.3B/활성 9.3B 파라미터로 모델 크기를 줄였습니다.
전체 학습 및 압축 세부 정보는 기술 보고서를 참조하세요: Nemotron-Labs-3-Puzzle-75B-A9B: Compressing Hybrid MoE LLMs.
Nemotron-3-Super와 비교했을 때, Puzzle-75B-A9B는:
- 사용자 처리량 제약 조건이 동일한 단일 8×B200 노드에서 서버 처리량을 약 2배 달성함,
- 1M 토큰 단일 H100 동시 처리 요청 수를 1개에서 8개로 증가시킴,
- 추론, 코딩, 다국어, 긴 컨텍스트 및 에이전트 벤치마크 전반에서 강력한 정확도를 유지함.
지원되는 언어는 영어, 프랑스어, 독일어, 이탈리아어, 일본어, 스페인어, 중국어입니다.
이 모델은 상업적 사용이 가능합니다.


