[audio.cpp] GGML의 소리 — C++/GGML 기반 ACE-Step, Stable Audio, HeartMuLa, RoFormer, HTDemucs 출시. 10분짜리 음악을 60초 만에!
[audio.cpp] The Sound of GGML — C++/GGML native ACE-Step, Stable Audio, HeartMuLa, RoFormer, HTDemucs released. 10-Minute Music in 60 Seconds!
핵심 요약
audio.cpp 프레임워크가 음악/SFX 생성 및 소스 분리 기능을 대폭 확장하여 C++ 환경에서 더 빠른 오디오 처리를 지원합니다.
- 기능 확장 — 음악 및 SFX 생성, 소스 분리 기능 추가됨
- 성능 개선 — Python 대비 최대 9.97배 빠른 실시간 생성 속도 달성
- 모델 지원 — ACE-Step, HeartMuLa, Stable Audio 3 등 최신 모델 포함
- 프레임워크 발전 — TTS를 넘어 음성 변환, diarization 등 통합 처리 가능
audio.cpp에 대규모 음악/오디오 확장 기능을 방금 출시했음.
이번 배치는 출시된 프레임워크 표면에 음악 생성, SFX 생성, 그리고 소스 분리 기능을 추가함:
새로 출시된 모델:
- ACE-Step 1.5 Turbo / Base
- HeartMuLa
- Stable Audio 3 Small Music / SFX
- Stable Audio 3 Medium
- Mel-Band RoFormer
- HTDemucs
보너스: HeartMuLa는 더 이상 기존의 짧은 길이 제한에 묶여 있지 않음. 이제 한 번 실행으로 약 10분 분량의 오디오를 생성할 수 있음.
현재 프레임워크 진행 상황: 21 / 28 (75%)
이건 더 이상 단순한 “C++ 기반 TTS”가 아님. audio.cpp 릴리스는 이제 동일한 네이티브 C++/ggml 프레임워크 경로를 통해 음성, 보이스, ASR/VAD/화자 분리(diarization), 음성 변환, 음악/SFX 생성, 그리고 소스 분리까지 모두 커버할 수 있음.
ACE-Step Turbo, 600초 음악 생성
audio.cpp: 60.16초 wall time, RTF 0.100, 9.97배 실시간
Python: 88.52초 wall time, RTF 0.148, 6.78배 실시간
아직 모든 게 마법처럼 더 빠른 건 아님. HTDemucs는 내 테스트에서 현재 Python 경로보다 느리고, Stable Audio의 warm run 성능은 들쭉날쭉함. 이걸 숨기려는 건 아님. 이번 릴리스는 우선 엔드 투 엔드 경로를 공유 프레임워크에 올리는 것이 목적이고, 그 후에 백엔드별 성능을 최적화할 예정임.
이 모델들을 위한 장기 실행/서버 스타일 사용을 위해 mem_saver 모드가 있음. 추론 중 절대적인 피크치를 항상 줄여주는 건 아니지만, 속도를 크게 저하시키지 않으면서 실행 후 상주 VRAM을 줄여줄 수 있음.
레포: https://github.com/0xShug0/audio.cpp
다양한 GPU/CPU에서 이 모델들을 시도해본 사람들의 피드백을 환영함. 특히 긴 생성 시간, 이상한 프롬프트, 스템 분리 품질, 백엔드 문제, 성능 수치, 그리고 뭔가 깨지는 부분이 있다면 알려주길 바람.

