[audio.cpp] RTX 5090에서 3분 만에 10시간 분량 오디오 생성 (데모 포함)! C++/GGML 기반 Supertonic 3, MOSS-TTS, IndexTTS2, Irodori-TTS 공개
[audio.cpp] 10 hours of audio generated in 3 minutes on RTX 5090 (demo included)! C++/GGML based Supertonic 3, MOSS-TTS, IndexTTS2, and Irodori-TTS released
핵심 요약
audio.cpp 0.3 버전이 공개되어 Supertonic 3 등 5개 모델을 지원하며, CUDA 환경에서 압도적인 추론 속도를 보여줍니다.
- 성능 향상 — RTX 5090에서 10시간 분량 오디오를 3분 만에 생성함
- 신규 모델 지원 — Supertonic 3, MOSS-TTS, IndexTTS2, Irodori-TTS 추가됨
- GGUF 지원 — 모델별로 순차적으로 GGUF 포맷 지원 확대 예정
- 최적화 작업 — 파이썬 구현 대비 CUDA 환경에서 훨씬 빠른 속도 구현
audio.cpp 다시 돌아왔음. 아직 질리지 않았길 바라 :)
0.3 릴리즈에는 5개의 새로운 모델이 추가됨: Supertonic 3, MOSS-TTS-Local, MOSS-TTS-Nano, IndexTTS2, 그리고 Irodori-TTS.
하이라이트는 Supertonic 3임. CUDA(RTX 5090)에서 200배 이상의 실시간 성능을 낼 수 있고, CPU에서는 6배 이상, CUDA 스트리밍 모드에서는 약 47ms의 TTFT를 보여줌. 데모에서는 (조잡한 데모라 미안) 셜록 홈즈의 모험을 입력으로 사용해서 RTX 5090으로 약 3분 만에 10시간 분량의 오디오를 생성했음.
Supertonic 3는 작업하는 것도 꽤 재밌었음. 공식 구현체는 ONNX를 사용해서, 추론 경로를 리버스 엔지니어링하고 safetensors 가중치를 중심으로 다시 빌드해야 했음.
audio.cpp 버전은 CUDA에서 파이썬 구현체보다 훨씬 빠르고, CPU 성능은 비슷하거나 약간 더 빠름.
CUDA에서 큰 성능 향상을 보인 이유 중 하나는 ONNX 버전이 일부 노드를 CPU로 다시 보내기 때문에 GPU를 완전히 활용할 수 없기 때문임.
0.3에서 공개된 다른 모델들은 테스트 케이스에 따라 대략 비슷한 속도에서 2배 이상 더 빠른 속도를 보여줌. IndexTTS2 장문 테스트(6000자 입력 텍스트 + 2400자 감정 텍스트)에서 C++ 버전이 파이썬보다 5.65배 빠름.
GGUF 지원이 추가되었으며 모델별로 순차적으로 적용될 예정임.
기여와 피드백은 언제나 환영함. 모델 커버리지, 스트리밍, GGUF 지원, 백엔드 호환성, 성능, 테스트, 그리고 서버/UI 레이어 전반에 걸쳐 개선할 점이 아직 많음.
![[audio.cpp] RTX 5090에서 3분 만에 10시간 분량 오디오 생성 (데모 포함)! C++/GGML 기반 Supertonic 3, MOSS-TTS, IndexTTS2, Irodori-TTS 공개 이미지 1](https://external-preview.redd.it/Y2FjNTFyb3MzYWRoMfbEdUvhloBC4vs0ArJpRklsvGwUrRQnZe7XO7_QbQSt.png?width=734&height=384.293193717&auto=webp&crop=734:384.293193717,smart&s=842272b94aba0927939599affdf1cb21f70a46ff)


