모델: NVIDIA Nemotron-3-Puzzle-75B-A9B (NemotronHPuzzle) 지원 추가 - llama.cpp PR #25444
model: add NVIDIA Nemotron-3-Puzzle-75B-A9B (NemotronHPuzzle) support by YanissAmz · Pull Request #25444 · ggml-org/llama.cpp
핵심 요약
llama.cpp에 NVIDIA의 새로운 75B MoE 모델인 Nemotron-3-Puzzle-75B-A9B 지원이 추가되었습니다.
- 모델 아키텍처 — Mamba, MoE, Attention 레이어가 혼합된 하이브리드 구조임
- 성능 최적화 — 기존 120B 모델 대비 파라미터 수를 75B로 줄여 효율성을 높임
- MTP 지원 — 더 빠른 텍스트 생성을 위한 Multi-Token Prediction 기능을 지원함
- llama.cpp 통합 — 오픈소스 LLM 구동 프레임워크인 llama.cpp에서 공식 지원 시작됨
github.com
원문 사이트로 이동
75B MoE는 한번 찍먹해볼 만한 사이즈임. 지금 당장 돌려볼 수 있긴 한데(MTP 지원은 아직 안 됨),
이 모델은 Mamba, MoE, Attention 레이어를 섞어놓은 하이브리드 MoE 아키텍처를 씀. Nemotron-3-Super처럼 텍스트 생성 속도를 높여주는 Multi-Token Prediction(MTP)도 지원하고. 원본 모델이랑 비교해보면, Puzzle-75B-A9B는 전체 파라미터 120.7B / 활성 파라미터 12.8B에서 전체 75.3B / 활성 9.3B로 다이어트함.
이 모델 관련해서 r/LocalLLaMA에서 얘기 나눈 건 여기 있음: https://www.reddit.com/r/LocalLLaMA/comments/1upsdmi/nvidianvidianemotronlabs3puzzle75ba9bbf16_hugging/


