[audio.cpp] VibeVoice 1.5B 출시 — 90분짜리 팟캐스트를 22.95분에 처리, 실시간 대비 4.08배 빠름, 양자화 없이 파이썬보다 2.86배 빠름. 네이티브 C++/ggml
[audio.cpp] VibeVoice 1.5B released — 90-min podcast in 22.95 min, 4.08x real-time, 2.86x faster than Python without quantization. Native C++/ggml
핵심 요약
로컬 오디오 모델을 위한 C++/ggml 런타임 'audio.cpp'에 VibeVoice 1.5B 지원이 추가되어 성능이 크게 향상되었습니다.
- 성능 최적화 — VibeVoice 1.5B 모델이 파이썬 대비 2.86배 빠른 속도를 기록함
- 네이티브 런타임 — 파이썬 의존성을 제거하고 로컬 환경에서 효율적인 오디오 추론을 지원함
- 다양한 활용성 — 팟캐스트나 캐릭터 대화 등 긴 형식의 다중 화자 TTS에 최적화됨
- 향후 로드맵 — 음악 생성 모델 지원 및 설치 편의성을 위한 바이너리 배포 예정
나는 로컬 오디오 모델을 위한 C++/ggml 런타임인 audio.cpp의 개발자야.
방금 VibeVoice 1.5B 지원을 추가했고, 긴 형식의 다중 화자 TTS는 로컬 추론 런타임에 대한 좋은 스트레스 테스트가 되기 때문에 벤치마크 결과를 공유하고 싶었어.
RTX 5090에서의 결과:
VibeVoice 1.5B
Audio length: 5615.73s / 93.60 min
Wall time: 1376.84s / 22.95 min
RTF: 0.245
Speed: 4.08x faster than real time
Python baseline: 92.66 min audio in 65.70 min
**Speedup vs baseline: 2.86x**
Quantization: none
Diffusion steps: 10
핵심은 단순히 파이썬 설정의 번거로움을 피하는 것만이 아니야, 물론 그것도 이유 중 하나지만. 목표는 재사용 가능한 세션, 서버와 같은 사용 방식, 긴 형식의 생성, 안정적인 메모리 동작, 그리고 CUDA 중심(추후 CPU 및 Metal 지원 예정) 최적화를 통해 오디오 모델을 네이티브 로컬 런타임에서 실용적으로 만드는 거야.
VibeVoice는 단순한 짧은 문장 TTS가 아니기 때문에 유용한 이정표가 돼. 이 모델은 팟캐스트, 캐릭터 채팅, 내레이션과 같이 런타임 동작이 매우 중요한 긴 형식의 다중 화자 대화를 위해 설계되었어.
현재 프레임워크 진행 상황:
Released model families: 16 / 28
[███████████░░░░░░░░░] 57%
다른 모델 제품군들도 내부적으로는 이미 엔드 투 엔드로 실행되고 있지만, 테스트와 정리 과정을 거쳐 순차적으로 출시할 예정이야.
저장소 주소는 https://github.com/0xShug0/audio.cpp 야.
다른 GPU나 CPU에서 VibeVoice를 테스트해 본 사람들의 피드백이 궁금해. 특히 긴 프롬프트, 다중 화자 포맷팅, VRAM 동작, 성능 수치 등에 대한 의견을 환영해.

