nvidia/Nemotron-Labs-Audex-30B-A3B · 허깅페이스
nvidia/Nemotron-Labs-Audex-30B-A3B · Hugging Face
핵심 요약
NVIDIA에서 텍스트와 오디오를 통합한 30B 규모의 멀티모달 LLM인 Audex-30B-A3B를 공개함.
- 멀티모달 기능 — 텍스트와 오디오를 통합하여 음성 인식, 생성, 번역 등 다양한 오디오 작업 수행 가능함.
- 모델 아키텍처 — 30B MoE 모델 기반으로 3B 파라미터가 활성화되며, 텍스트 성능을 유지하면서 오디오 기능 확장됨.
- 추론 모드 — 생각(thinking) 모드와 일반 지시(instruct) 모드를 모두 지원하며 최대 1M 토큰의 컨텍스트 길이 제공함.
- 사용 편의성 — ChatML 템플릿을 따르며 오디오 작업별로 최적화된 추론 설정 가이드 제공함.
huggingface.co
원문 사이트로 이동
소개
Nemotron-Labs-Audex-30B-A3B를 소개하게 되어 기쁩니다. 이 모델은 30B MoE 모델에 3B 활성 파라미터를 가진 강력한 텍스트 전용 LLM인 Nemotron-Cascade-2-30B-A3B를 기반으로 구축된 통합 오디오-텍스트 LLM입니다. Audex-30B-A3B는 음성 및 일반 오디오 출력에 사용되는 이산 오디오 토큰의 어휘를 확장했으며, 음성 및 일반 오디오 입력을 위한 오디오 인코더도 포함하고 있습니다. Audex-30B-A3B는 텍스트 전용 LLM 백본이 가진 추론, 정렬, 지식, 긴 컨텍스트, 에이전트 기능을 거의 그대로 유지하면서 오디오 작업(오디오 이해, 음성 인식 및 번역, 텍스트-음성 변환, 오디오 생성, 음성-음성 생성)에서 강력한 성능을 발휘합니다. Audex-30B-A3B는 thinking 모드와 instruct(비-thinking) 모드 모두에서 작동합니다.
빠른 시작
- Audex-30B-A3B는 ChatML 템플릿을 따르며 thinking 및 instruct(비-thinking) 모드를 모두 지원합니다. 추론 내용은
<think>와</think>태그 사이에 포함됩니다. instruct(비-thinking) 모드를 활성화하려면 어시스턴트 응답 시작 부분에<think></think>를 추가하면 됩니다. - Audex-30B-A3B는 최대 1M 토큰의 컨텍스트 길이를 지원합니다.
- Audex-30B-A3B는 텍스트 평가에서 Nemotron-Cascade-2를 따릅니다.
- Audex-30B-A3B는 아래 설명된 대로 오디오 관련 작업별로 권장되는 추론 설정이 다릅니다.
https://huggingface.co/nvidia/Nemotron-Labs-Audex-30B-A3B#environment
수많은 벤치마크는 모델 카드를 확인하세요.
추가 모델:


