meituan-longcat/LongCat-Video-Avatar-1.5 · 허깅페이스
meituan-longcat/LongCat-Video-Avatar-1.5 · Hugging Face
핵심 요약
오디오 기반 아바타 영상 생성 모델인 LongCat-Video-Avatar 1.5가 MIT 라이선스로 공개되었습니다.
- 성능 향상 — Whisper-Large 인코더를 도입하여 입 모양 움직임이 훨씬 자연스러워짐.
- 생산성 최적화 — 8단계 추론으로 효율성을 높이고 상업적 수준의 안정성을 확보함.
- 도메인 확장 — 애니메이션, 동물, 다중 인물 등 다양한 환경에서 범용적인 생성 가능.
- 오픈 소스 — MIT 라이선스로 배포되어 누구나 자유롭게 활용할 수 있음.
🚀 모델 소개
LongCat-Video-Avatar 1.5의 출시를 발표하게 되어 기쁩니다. 이 모델은 오디오 기반 인간 영상 생성을 위해 극단적인 경험적 최적화와 상업적 준비 상태를 우선시하는 업그레이드된 오픈 소스 프레임워크입니다. LongCat-Video 기반 모델을 토대로 구축된 v1.5는 Audio-Text-to-Video(AT2V), Audio-Text-Image-to-Video(ATI2V), 영상 이어붙이기(Video Continuation) 등 기본 작업을 지원하며, 단일 및 다중 스트림 오디오 입력과 원활하게 호환되는 상업용 등급의 안정적인 아바타 영상 합성을 제공합니다.
주요 기능
- 🌟 업그레이드된 오디오 인코더 (Whisper-Large): Wav2Vec2를 Whisper-Large로 교체하여 훨씬 부드럽고 자연스러운 입 모양 움직임을 구현했습니다.
- 🌟 상업용 수준의 안정성: 정확한 입 모양 동기화, 전신 시간적 안정성, 엄격한 정체성 일관성을 유지하며 긴 영상을 안정적으로 생성합니다.
- 🌟 스타일 도메인 일반화: 애니메이션, 동물, 다중 인물 상호작용 및 객체 조작과 같은 복잡한 실제 환경에서도 강력하게 일반화됩니다.
- 🌟 효율적인 8단계 추론: 고급 DMD2 기반 단계 증류(step distillation)를 통해 추론 속도를 8 NFE로 가속화하여, 비용 효율적인 서비스와 뛰어난 시각적 품질 사이의 균형을 맞췄습니다.
📊 인간 평가
우리는 오디오 기반 디지털 휴먼 생성을 위해 특별히 설계된 포괄적인 인간 평가 벤치마크를 도입했습니다. 이 벤치마크는 6가지 응용 시나리오(뉴스 방송, 지식 교육, 일상생활, 엔터테인먼트, 노래, 상업 홍보), 2가지 언어(중국어/영어), 2가지 시각적 스타일(실사/애니메이션)을 포함하며, 총 508개의 이미지-오디오 소스 쌍을 생성합니다. 평가 방법론: (1) 주관적 트랙: 770명의 크라우드소싱 평가자가 생성된 각 영상을 1~5점 척도로 평가하여 13,240개의 판단을 도출했습니다. (2) 객관적 트랙: 10명의 도메인 전문가가 물리적 합리성, 조화(시청각 조정), 시간적 안정성, 정체성 일관성이라는 네 가지 차원에서 구조화된 품질 분석을 수행했습니다.
⚖️ 라이선스 계약
모델 가중치는 MIT 라이선스 하에 공개됩니다.


