[audio.cpp] 놓치지 말아야 할 최근 업데이트: Higgs Audio TTS VRAM 48% 절감(6GB 미만), HTDemucs 2.2배 및 PocketTTS 2.2배(CPU) 속도 향상, WebUI 생성 기록 기능 추가
[audio.cpp] Recent updates you might have missed: Higgs Audio TTS use 48% less VRAM (< 6GB), HTDemucs 2.2× faster, PocketTTS 2.2× faster on CPU, and WebUI generation history feature
핵심 요약
audio.cpp가 주요 TTS 모델의 VRAM 효율과 추론 속도를 대폭 개선하고 WebUI 기능을 강화했습니다.
- 성능 최적화 — Higgs Audio TTS의 VRAM 사용량을 6GB 미만으로 48% 절감함
- 속도 향상 — HTDemucs와 PocketTTS의 추론 속도를 각각 2.2배 이상 가속함
- 기능 업데이트 — WebUI에 생성 기록 및 설정 복원 기능이 추가됨
- 기여자 모집 — 다양한 모델 지원에 따른 UI/UX 개선을 위한 프론트엔드 개발자 모집 중

다들 안녕, audio.cpp에 성능 개선 사항들이 잔뜩 들어갔어.
가장 큰 핵심은 Higgs Audio TTS인데, 이제 6 GB VRAM 정도면 돌아가. 이전 구현 대비 피크 메모리 사용량이 48%나 줄어든 거지. https://github.com/mirek190 덕분이야.
몇몇 모델들은 속도도 엄청 빨라졌어. 특히 GPU에서 돌리는 HTDemucs랑 CPU에서 돌리는 PocketTTS가 체감이 확 될 거야.
물론 성능이나 정확도는 그대로니까 걱정 마.
개선 사항 요약은 여기 있어:
| Model | Peak memory reduction | Speedup |
|---|---|---|
| Higgs Audio TTS | 48% VRAM | 1.01–1.09× CUDA |
| ACE-Step family | 6–7% VRAM | 1.06–1.08× CUDA, 1.16–1.20× Vulkan |
| MOSS-TTS v1.5 cloning | 21% VRAM | 1.05× CUDA |
| MOSS-TTSD Q8 cloning | 11% VRAM | 1.04× CUDA |
| Echo-TTS (Memory Saver) | 20% VRAM | — |
| Qwen3-TTS | 16–20% VRAM | — |
| IndexTTS2 / 2.5 | 12% VRAM | — |
| HTDemucs | — | 2.21× CUDA, 1.95× Vulkan |
| HTDemucs six-stem | — |

