FireRedTeam의 FireRedAudio 및 FireRedTTS3 - Huggingface
FireRedAudio & FireRedTTS3 by FireRedTeam - Huggingface
핵심 요약
FireRedTeam이 공개한 통합 오디오 언어 모델 FireRedAudio와 다국어 음성 생성 시스템 FireRedTTS3에 대한 소개입니다.
- FireRedAudio — ASR, TTS, 음성 편집 및 긴 오디오 이해를 지원하는 9B 파라미터 통합 모델임
- FireRedTTS3 — 24개 언어와 21개 중국 방언을 지원하는 고성능 음성 생성 및 편집 시스템임
- 기술적 특징 — 이해와 생성을 분리한 구조로 자연어 기반 음성 설계 및 편집이 가능함
- 오픈소스 생태계 — 다양한 AI 프로젝트와 논문을 지속적으로 발표하는 활발한 연구팀임
FireRedAudio: 이해와 생성을 위한 디커플링된 연속 표현 기반의 범용 오디오 언어 모델
-
HuggingFace : https://huggingface.co/FireRedTeam/FireRedAudio
개요
FireRedAudio는 **디커플링된 연속 표현(decoupled continuous representations)**을 사용하는 9B 파라미터 LLM 기반의 범용 오디오 언어 모델이야. 오디오 인코더가 이해를 담당하고, RedAE 경로가 생성을 담당하는 구조지. 모델 하나로 **ASR, 오디오 이해, 제로샷 TTS, 인스트럭트 TTS, 의미론적/음향적 음성 편집, 그리고 최대 1시간 길이 녹음본에 대한 정확한 시간 기반 그라운딩(temporal grounding)**까지 전부 다 돼.
주요 특징 ✨
-
🧩 목적에 맞춘 표현, 하나로 합친 백본 — 오디오 인코더 경로는 이해를, RedAE-Patch 경로는 음성 생성을 담당해. 각자의 표현 방식은 분리되어 있지만, 언어와 추론을 담당하는 백본은 공유하지. 우리가 알기로는 통합 오디오-언어 모델 중에서 이런 식으로 설계된 건 이게 처음이야.
-
📊 모델 하나로 오디오 작업 끝 — FireRedAudio는 ASR, 광범위하고 세밀한 오디오 이해, 제로샷 TTS, 인스트럭트 TTS, 자유 형식 음성 편집까지 다 커버해. MMAU, MMSU, Seed-TTS-Eval, InstructTTSEval, Ming-Freeform-Audio-Edit 같은 벤치마크에서 경쟁력 있거나 아예 1등 먹는 성능을 보여줌.
-
🎙️ 자연어로 음성 생성 및 편집 — 레퍼런스 클립에서 목소리를 복제하거나, 설명만으로 목소리를 디자인하고, 연속 잠재 생성 경로 하나로 말하는 내용이나 음색을 마음대로 수정할 수 있어.
-
⏱️ 분 단위에서 시간 단위 녹음까지 — 최대 1시간짜리 녹음본도 내용과 시간을 딱 맞춰서 이해해. 오디오를 타임스탬프 기반으로 정리하고, 근거가 포함된 요약본을 만들고, 시간으로 내용을 찾거나 내용으로 시간을 찾는 등 녹음 전체에 걸친 증거를 추론할 수 있어.

