Hy3 (295B MoE) 및 NVIDIA Nemotron-Labs-Audex-30B-A3B (오디오 지원 30B MoE) GGUF 양자화 모델 공유
Hy3 (295B MoE) and NVIDIA Nemotron-Labs-Audex-30B-A3B (audio-capable 30B MoE) GGUF quants
핵심 요약
Tencent의 Hy3와 NVIDIA의 Audex-30B 모델에 대한 GGUF 양자화 버전과 상세 벤치마크 데이터를 공유합니다.
- Hy3 모델 — 295B 파라미터 MoE 모델의 GGUF 양자화 버전 제공
- Audex-30B 모델 — 텍스트 및 오디오 처리가 가능한 하이브리드 MoE 모델 지원
- 데이터 투명성 — 모든 양자화 버전의 KLD, PPL, 처리량 등 벤치마크 데이터 공개
- 사용 주의사항 — NVIDIA 모델의 비상업적 라이선스 및 특정 하드웨어 요구사항 안내
GGUF 양자화 세트 두 개 공유한다. 둘 다 똑같이 imatrix 양자화 먹였고, BF16 레퍼런스 로짓 대비 KLD/PPL 측정값, llama-bench 처리량, 그리고 벤치마크 원본 데이터까지 전부 레포에 다 때려 박아놨다. "써보니까 좋더라" 같은 뇌피셜은 없다. 레포에 있는 파일로 숫자 하나하나 다 재현 가능하다.
1. Hy3 — 텐센트의 295B MoE (활성 21B)
베이스: tencent/Hy3 — 295B MoE, 활성 21B, 262K 컨텍스트, Apache 2.0 라이선스. Hy3 지원하는 llama.cpp 브랜치로 BF16에서 변환했고, imatrix는 커스텀 캘리브레이션 코퍼스로 돌림.
| Quant | Size | Mean KLD | Top-token agreement | Gen tok/s* |
|---|---|---|---|---|
| Q6_K | 226 GiB | 0.0207 | 95.1% | 57.4 |
| Q4_K_M | 167 GiB | 0.0904 | 90.0% | 67.3 |
| Q3_K_L | 143 GiB | 0.1624 | 86.8% | 63.3 |
| IQ2_M | 90 GiB | 0.5314 | 74.7% | 78.7 |
*8x RTX PRO 6000 Blackwell, 레이어 분할, F16 KV 캐시 사용. 품질 측정: WikiText-2, 128 청크 x 512 컨텍스트 vs BF16 no-MTP 레퍼런스 로짓.
추천: 램 256GB 정도 있으면 Q6_K가 사실상 무손실이다. Q4_K_M은 국룰(96GB GPU 2장 컷). IQ2_M은 96GB 카드 한 장이나 128GB 맥에 꾸역꾸역 들어가긴 하는데, 품질 저하는 감수해야 함.
주의사항: --split-mode layer 써라 (이 아키텍처는 CUDA 디코드에서 텐서 스플릿 쓰면 뻗음). 그리고 MTP/NextN 블록은 일부러 뺐다. 직접 양자화 돌려보고 싶으면 레포에 imatrix, 캘리브레이션 코퍼스, 전체 재현 스크립트 다 있으니까 알아서 해라.
2. Nemotron-Labs-Audex-30B-A3B — 엔비디아의 오디오 지원 30B 하이브리드 MoE
LordNeel/Nemotron-Labs-Audex-30B-A3B-GGUF
베이스: nvidia/Nemotron-Labs-Audex-30B-A3B — 30B Nemotron-H 하이브리드 MoE, 토큰당 활성 약 3B, 1M 컨텍스트, 오디오 이해 및 생성 가능. 레포 하나에 두 가지 트랙이 있음:


