현재 오디오북 내레이션용으로 가장 좋은 오픈소스 TTS는?
Best Open source TTS right now for narration?
핵심 요약
오디오북 내레이션을 위한 고품질 오픈소스 TTS 모델과 도구에 대한 사용자들의 추천과 경험 공유.
- 추천 모델 — BreezeTTS 2, Higgs Audio V3, Fish Audio S2 Pro가 내레이션용으로 자주 언급됨.
- 도구 추천 — audio.cpp를 사용하면 다양한 모델을 로컬에서 효율적으로 테스트 가능함.
- 기능적 요구사항 — 음성 복제, 감정 제어 태그, 자연스러운 발화가 핵심 고려 요소임.
- 사용자 경험 — 모델별로 라이선스 문제나 복제 품질의 일관성 차이가 존재함.
Kaggle 노트북에서 모델을 돌리고 있어서 conda 환경을 쓰는 모델 같은 건 호환이 안 되더라고. (아니면 내가 Kaggle에서 돌리는 방법을 아직 못 찾은 걸 수도 있고.)
지금은 Chatterbox 포크 버전인 Chatterbox Audiobook을 쓰고 있어. Chatterbox에서 거의 완벽에 가까운 오디오 클립을 뽑아내려고 최적화된 워크스테이션 같은 느낌이야. 근데 Chatterbox의 유일한 단점이 출력값을 조절할 수 있는 감정 슬라이더나 태그가 없다는 거거든. Chatterbox Turbo는 태그로 그걸 해결한 것 같긴 한데, Google Gemini TTS에서 보여주는 그 다양한 감정 표현까지는 아직 안 되는 것 같아. 그렇다고 Google Gemini를 쓰자니 생성할 때마다 목소리가 계속 바뀌어서 RVC를 써도 고치기가 힘들더라고.
지금 리더보드 보니까 Breeze TTS라는 게 있던데, 이건 한 번도 안 써봤거든. 설명 보니까 주로 실시간 작업용인 것 같아서 좀 애매하네. 오디오북 내레이션용으로 지금 꼭 써봐야 할 만한 옵션 뭐가 있을까?
내가 찾는 기능은 보이스 클로닝, 감정 태그, 그리고 자연스러운 말투야. 의견 좀 주면 진짜 고맙겠다.


