[audio.cpp] 0.4 버전 출시: Higgs Audio v3 TTS 4B(실시간 10배 속도) + Fish Audio S2 Pro(C++/GGML), 전체 GGUF 로딩, Q8 속도 및 VRAM 개선
[audio.cpp] Release 0.4: Higgs Audio v3 TTS 4B (10x real time)+ Fish Audio S2 Pro in C++/GGML, full GGUF loading, Q8 speed and VRAM gains
핵심 요약
audio.cpp 0.4 버전이 출시되어 GGUF 지원 강화와 함께 Higgs Audio v3, Fish Audio S2 Pro 등 고성능 TTS 모델의 실시간 추론 속도가 대폭 향상되었습니다.
- 모델 지원 확대 — Higgs Audio v3, Fish Audio S2 Pro 등 35개 모델 패밀리 지원함
- GGUF 최적화 — 모든 모델 패밀리에서 GGUF를 지원하며 Q8 양자화로 속도와 VRAM 효율 개선됨
- 성능 향상 — RTX 5090 기준 Higgs Audio TTS는 실시간 대비 최대 10배 빠른 속도 기록함
- 커뮤니티 모델 — 프레임워크 모듈을 활용해 누구나 쉽게 모델을 포팅할 수 있는 커뮤니티 영역 추가됨
audio.cpp 또 왔음 :)
릴리즈 0.4 나왔다. 이번 핵심은 고품질 TTS 지원 대폭 늘린 거랑, GGUF가 프로젝트 전반에서 1티어 대접받게 된 거임.
새로 바뀐 점:
-
Higgs Audio v3 TTS 4B, Fish Audio S2 Pro, Voxtral Realtime ASR, 그리고 커뮤니티 모델인 OuteTTS랑 VieNeu-TTS-v3 추가함.
-
이제 audio.cpp에서 35개 모델 패밀리 지원함.
-
출시된 모든 모델 패밀리에서 GGUF 지원함.
바로 쓸 수 있는 GGUF 패키지 올라왔고, Q8은 여러 경로에서 속도랑 메모리 효율 확실히 보여주는 중임. 수치 확인해 봐. 'Long-lived session'은 웜업 이후 여러 번 요청 보낸 거고, 'Longform'은 6000자 넘는 텍스트 한 번에 뽑은 거임. RTX 5090에서 테스트함.
지금 내가 측정한 CUDA Q8 GGUF 수치:
-
Higgs Audio TTS: 웜업된 요청은 실시간 대비 약 8.8배~10.1배 빠름. Longform은 약 8.5배 빠름.
-
Fish Audio S2 Pro: 웜업된 요청은 실시간 대비 약 3.1배~3.4배 빠름. Longform은 약 3.3배 빠름. 이건 구현이 그냥 프레임워크 템플릿 대충 갖다 쓴 거라 개선할 여지 많음.
-
Voxtral ASR: 오프라인은 실시간 대비 약 15.7배 빠르고, 스트리밍 TTFT는 171ms 정도 나옴.
16비트 GGUF랑 비교하면 Q8이 무조건 만능은 아니지만, 이제 쓸만함. 테스트한 릴리즈 경로에서는 모델이랑 경로에 따라 Q8이 최대 1.5배 정도 빠르고 VRAM 피크도 37%까지 줄여줌. 퀄리티는 여전히 모델마다 다르니까, 모든 양자화가 다 안전한 척하는 대신 GGUF 지원 매트릭스랑 Q8 성능 리포트 계속 공개할 예정임.
(Qwen3-TTS 같은 모델에서 성능 2배까지 땡길 수 있는 팁: 청크 사이즈 조절하고 레퍼런스 오디오 길이 좀 줄여보셈.)
이제 audio.cpp에 커뮤니티 모델 전용 공간 만들었음. 아직 좀 다듬어야 할 부분 있어도 쓸만하고 돌릴 수 있는 모델들은 여기 올리면 됨. 여기는 핵심 프레임워크보다는 검토 기준이 좀 널널함. audio.cpp에 올리고 싶은 모델 있으면 프레임워크 모듈이랑 패턴 써서 커뮤니티 모델로 먼저 구현해 봐.
모델 포팅하고 최적화하고, 새로운 기능 넣으면서 프로젝트 끌고 가주는 기여자들한테 진짜 고맙다.


