Gepard: 실시간 대화를 위한 0.6B 스트리밍 TTS - 20배 실시간 성능, ~50ms 첫 오디오 응답, vLLM 네이티브, Apache 2.0
Gepard : 0.6B streaming TTS built for real-time dialogue - 20× realtime factor, ~50ms time-to-first-audio, vLLM-native, Apache 2.0
핵심 요약
실시간 대화에 최적화된 0.6B 파라미터의 고성능 스트리밍 TTS 모델 Gepard 1.0이 공개되었습니다.
- 고성능 스트리밍 — 텍스트 입력 즉시 오디오 생성으로 50ms 수준의 TTFA 달성
- 경량 아키텍처 — Qwen3.5 0.8B 기반 및 Nemo NanoCodec 사용
- 다국어 지원 — 영어, 스페인어, 포르투갈어, 네덜란드어 지원 및 제로샷 음성 복제 가능
- 오픈 소스 — Apache 2.0 라이선스로 공개되어 vLLM 환경에서 구동 가능
huggingface.co
원문 사이트로 이동
우리는 실시간 대화를 위해 구축된 TTS 모델인 Gepard 1.0을 오픈 소스로 공개했습니다. 스트리밍 우선 방식이라 전체 문장을 기다리지 않고 텍스트가 들어오는 즉시 프레임 단위로 오디오가 생성됩니다.
- ~555M 파라미터: Qwen3.5 0.8B 백본(14개 레이어) + Nemo NanoCodec(FSQ, 22.05kHz)
- ~20배 RTF, vLLM을 통한 RTX 5090 기준 ~50ms TTFA
- RTX Pro 6000 Blackwell(96GB VRAM) 기준 최대 256개 병렬 시퀀스 처리
- 몇 초 분량의 참조 음성으로 제로샷 음성 복제 가능
- 지원 언어: 영어(미국/영국), 스페인어(멕시코), 포르투갈어(브라질), 네덜란드어
- Apache 2.0 라이선스
벤치마크(Seed-TTS-eval): VoxCPM2, Fish-S2, OmniVoice, Qwen3-TTS, Echo-TTS, Chatterbox Turbo와 동일한 텍스트로 직접 비교했습니다.
Gepard는 NISQA-MOS(4.25)에서 최고점을 기록하며 인지 품질 면에서 앞서고 있으며, 노이즈, 색채감, 불연속성 측면에서도 가장 깨끗한 성능을 보여줍니다.
솔직한 트레이드오프: 스트리밍 우선 설계로 인해 화자 유사성(SIM 0.585)과 WER(0.036)에서 손해를 보았습니다. 따라서 정확한 음성 일치보다는 자연스러운 실시간 음성이 더 중요한 경우에 적합합니다.
링크:
vLLM serving (Cartesia 호환 API)
또한 저희 웹사이트에서 vLLM으로 어떻게 작동하는지 확인하실 수 있습니다: https://www.nineninesix.ai
아키텍처나 추론에 관해 궁금한 점이 있으시면 언제든 답변해 드리겠습니다!

