OmniVoice - 600개 이상의 언어를 지원하는 오픈소스 TTS (음성 복제 및 디자인 포함)
Omnivoice - 600+ Language Open-Source TTS with Voice Cloning and Design
핵심 요약
600개 이상의 언어를 지원하며 빠른 추론 속도와 뛰어난 음성 복제 기능을 갖춘 차세대 오픈소스 TTS 모델.
- 언어 지원 — 600개 이상의 언어를 지원하여 제로샷 TTS 모델 중 가장 넓은 커버리지를 자랑함.
- 음성 복제 — 최첨단 기술을 통해 고품질의 음성 복제 및 디자인 기능을 제공함.
- 추론 속도 — 확산 언어 모델 아키텍처를 기반으로 실시간 대비 40배 빠른 속도를 구현함.
- 라이선스 이슈 — 토크나이저로 사용된 Higgs Audio의 상업적 이용 제한 라이선스를 포함함.
OmniVoice는 600개 이상의 언어를 지원하는 최첨단 제로샷 다국어 TTS 모델입니다. 새로운 확산 언어 모델 아키텍처를 기반으로 구축되어 뛰어난 추론 속도로 고품질 음성을 생성하며, 음성 복제 및 음성 디자인을 지원합니다.
주요 기능
-
600개 이상의 언어 지원: 제로샷 TTS 모델 중 가장 넓은 언어 커버리지
-
음성 복제: 최첨단 음성 복제 품질
-
음성 디자인: 지정된 화자 속성(성별, 나이, 음조, 방언/억양, 속삭임 등)을 통해 음성 제어 가능
-
빠른 추론: 0.025만큼 낮은 RTF (실시간 대비 40배 빠름)
-
확산 언어 모델 아키텍처: 품질과 속도를 모두 제공하는 깔끔하고 간소화된 확장 가능한 설계
데모: https://huggingface.co/spaces/k2-fsa/OmniVoice
HuggingFace: https://huggingface.co/k2-fsa/OmniVoice
모델 카드는 Apache-2.0을 주장하지만 토크나이저는 Higgs Audio이며 따라서 해당 라이선스를 상속받습니다:
- 추가 상업적 조건. 라이선스 사용자 또는 라이선스 사용자의 계열사가 제공하는 제품 또는 서비스의 연간 활성 사용자 수가 전년도 기준 100,000명을 초과하는 경우, Boson AI에 확장 라이선스를 요청해야 하며, Boson AI는 재량에 따라 이를 부여할 수 있습니다. 귀하는 Boson AI가 명시적으로 그러한 권리를 부여하지 않는 한 이 계약에 따른 어떠한 권리도 행사할 권한이 없습니다.


