텐센트(Tencent)의 AuK-Flash · 허깅페이스
tencent/AuK-Flash · Hugging Face
핵심 요약
음성 생성 및 편집을 4단계로 빠르게 처리하는 1.5B 규모의 통합 음성 모델 AuK-Flash가 공개되었습니다.
- 통합 음성 모델 — TTS, 음성 편집, 향상, 분리 등 다양한 작업을 단일 인터페이스로 지원함
- 경량화된 성능 — 1.5B 파라미터 모델로 4단계 추론을 통해 빠른 속도를 구현함
- 다양한 편집 기능 — 감정, 억양, 속도, 음량 조절 및 비언어적 소리 제거 등이 가능함
- 오픈 소스 공개 — 허깅페이스와 모델스코프를 통해 공식 가중치를 배포함
huggingface.co
원문 사이트로 이동
AuK-Flash: 4단계로 끝내는 초고속 음성 생성 및 편집
-
arXiv : https://arxiv.org/abs/2609.08936
-
Full Paper : https://arxiv.org/pdf/2609.08936
-
Project : https://auk-project.github.io/
소개
AuK는 음성 생성과 편집을 위한 1.5B 파라미터 파운데이션 모델이야. 수백만 시간의 방대한 오디오 데이터를 학습했고, 제로샷(zero-shot) 및 지시어 기반 TTS, 콘텐츠 및 음향 편집, 준언어적(paralinguistic) 편집, 음성 향상, 음원 분리까지 전부 통합된 자연어 지시어 인터페이스로 처리할 수 있어. AuK는 크게 두 가지 버전으로 나뉘어:
| Model | Description | Weight |
|---|---|---|
| AuK | Base model for high-quality generation | 🤗 Hugging Face · 🤖 ModelScope |
| AuK-Flash | Distilled model for fast 4-step inference | 🤗 Hugging Face · 🤖 ModelScope |
이 저장소에는 4단계 추론으로 속도를 대폭 끌어올린 증류 모델, AuK-Flash의 공식 가중치가 포함되어 있어.
지원 작업
AuK는 모든 작업을 동일한 자연어 지시어 인터페이스로 수행해. 아래 표는 지원하는 작업들을 카테고리별로 정리한 거야. 간단한 설명과 함께 Cookbook의 해당 섹션 링크를 달아놨으니, 지시어 템플릿이나 CLI, Python 예제 코드가 필요하면 참고해.

