audio.cpp: 12개의 오디오 모델(Qwen3-TTS, PocketTTS, VeVo2 등)을 지원하는 C++/ggml 런타임 — Python 대비 최대 5배 빠른 CUDA TTS
audio.cpp: 12 audio models (Qwen3-TTS, PocketTTS, VeVo2 etc) in 1 C++/ggml runtime — TTS up to 5x faster than Python on CUDA
핵심 요약
ggml 기반의 네이티브 C++ 오디오 추론 프레임워크인 audio.cpp를 통해 다양한 오디오 모델을 통합하고 성능을 최적화함.
- 통합 런타임 — 파이썬 의존성 없이 다양한 오디오 모델을 하나의 C++ 환경에서 실행함
- 성능 최적화 — CUDA 환경에서 기존 파이썬 대비 최대 5배 이상의 추론 속도를 달성함
- 다양한 모델 지원 — TTS, ASR, 음성 변환 등 12개 모델을 즉시 사용 가능함
- 워크플로우 통합 — CLI 명령 하나로 음성 녹음부터 변환까지 전체 파이프라인 처리가 가능함
ggml 기반으로 오디오 모델 추론을 돌리는 네이티브 C++ 프레임워크인 audio.cpp를 만들고 있다.
현재 프레임워크에 들어간 모델은 총 25개인데, 정확히 말하자면 지금 레포에 릴리즈돼서 바로 쓸 수 있는 건 12개다. 통합이나 최적화 중인 건 릴리즈된 걸로 안 쳤다.
릴리즈된 모델들은 이미 꽤 다양한 기능을 커버한다:
TTS / 음성 복제 / 음성 디자인: Chatterbox, MioTTS, OmniVoice, PocketTTS, Qwen3-TTS, VoxCPM2
ASR / 정렬 / VAD: Qwen3-ASR, Qwen3 Forced Aligner, Silero VAD
음성 변환 / 코덱 / 편집: Seed-VC, MioCodec, Vevo2
Vevo2는 TTS, 노래 생성, 노래 변환, 편집까지 다 되니까 이제 단순한 TTS 포트 모음집 수준은 넘어섰다고 보면 된다.
이 프로젝트의 목적은 단순히 모델만 잔뜩 모아놓는 게 아니다.
모델마다 제각각인 파이썬 환경, 의존성 트리, CLI, 배치 로직, 배포 설정 때문에 골치 아픈 상황을 끝내려는 거다. 모든 모델이 런타임, 세션 처리, CLI, 서버, 오디오 유틸리티를 공유하고, 나중에는 더 상위 수준의 워크플로우까지 통일해서 쓰게 만드는 게 목표다.
성능 면에서 이제야 단순히 배포가 편한 수준을 넘어 진짜 쓸만하다는 느낌이 든다.
아래 결과는 Ubuntu/CUDA 환경에서 양자화 안 된 원본 가중치를 사용해 측정한 거다. 파이썬 레퍼런스 대비 audio.cpp의 처리 속도를 비교했다:
PocketTTS: 1회 실행 시 3.68×, 웜 세션(warm session) 3.22×, 긴 문장 처리 시 3.15× 더 빠름
Qwen3-TTS: 1회 실행 시 1.83×, 웜 세션 2.74×, 긴 문장 처리 시 3.06× 더 빠름
Vevo2: 1회 실행 시 5.03×, 웜 세션 1.75×, 긴 문장 처리 시 1.77× 더 빠름
MioTTS: 1회 실행 시 2.73×, 웜 세션 더 빠름


