NVIDIA Puzzle-75B-A9B NVFP4, 3×3090에서 132 t/s 달성 — 왜 이 사이즈는 항상 불모지일까?
NVIDIA Puzzle-75B-A9B NVFP4 at 132 t/s on 3×3090 — Why is this size category a desert otherwise?
핵심 요약
75B MoE 모델이 소비자용 GPU 환경에서 최적의 성능을 내는 이유와 그 활용 가능성을 논의합니다.
- 모델 구성 — 75B 총 파라미터와 9B 활성 파라미터의 MoE 구조로 24GB VRAM 환경에 최적화됨
- 성능 지표 — 3개의 3090 GPU를 파이프라인 병렬로 구성하여 132 t/s의 디코드 속도 달성
- 하드웨어 효율 — 500W 전력 소모로 기존 120B 모델 대비 두 배의 속도와 더 나은 지시 이행 능력 제공
- 시장 공백 — 30B 이하와 120B 이상으로 양분된 모델 시장에서 75B급 모델의 희소성과 가치 강조
TLDR: 75B 총 파라미터 / 9B 활성 파라미터의 MoE는 24GB VRAM을 여러 개 쓰는 환경에 완벽한 형태인데, 이걸 내놓는 곳이 거의 없습니다. Qwen 27B는 훌륭한 모델이고 자기 체급보다 훨씬 뛰어난 성능을 보여줘서, 저는 자주 예비용으로 사용합니다.
Nemotron-3-Puzzle-75B-A9B, NVFP4, vLLM 0.22.1 (새로운 Marlin 폴백은 Ampere에서 FP4를 실행합니다), 3개의 3090에 파이프라인 병렬로 구성했고 각각 200W로 제한했습니다. 4번째 카드는 손대지 않은 상태로 음성 사이드카를 실행 중입니다.
-
3개 시트 × 256K 컨텍스트, fp8 KV — 하이브리드 Mamba가 캐시를 작게 유지합니다.
-
3개 스트림에 걸쳐 132 t/s 디코드 (단일 스트림 시 ~65 t/s), 1,949 t/s 프리필.
-
전체 박스 기준 벽 전력 소비 ~500W.
기존에 4x3090을 사용하던 Nemotron Super 120B MoE GGUF를 대체했습니다: 지시 이행 능력이 더 좋고, 와트당 속도는 대략 두 배입니다. 카드 하나가 남게 되었죠.
나머지 모델들은 30B-A3B(VRAM 3분의 2가 노는 상태)이거나 120B+(RAM으로 넘어가서 느려지거나 q2, q3 양자화가 필요함)입니다. 70~80B 총 파라미터 / ~10B 활성 파라미터는 72GB의 양자화된 VRAM을 정확히 채웁니다 — A3B급 속도에 덴스 모델급 품질이죠. 현재로서는 Puzzle이 이 대역에서 유일한 현대적인 선택지입니다.


