4.63M 파라미터의 초소형 TTS 모델, Inflect-Nano를 공개합니다.
I released Inflect-Nano, an ultra-extreme tiny 4.63m parameter TTS model.
핵심 요약
4.63M 파라미터로 작동하는 초소형 TTS 모델 Inflect-Nano가 공개되어 로컬 환경 및 임베디드 기기에서의 활용 가능성을 제시했습니다.
- 모델 구조 — 4.63M 파라미터의 음향 모델과 보코더로 구성됨
- 성능 효율 — 기존 TTS 모델 대비 압도적으로 작은 크기로 로컬 구동 가능
- 기술적 한계 — 영어 전용이며 로봇 같은 음질과 어려운 텍스트 처리 시 오류 발생 가능
- 향후 계획 — 피드백을 바탕으로 v2 버전 개발 및 성능 개선 고려 중
나는 실용적인 신경망 TTS 모델이 현실적으로 얼마나 작아질 수 있는지 실험해 왔고, 방금 Inflect-Nano-v1을 공개했어.
Inflect-Nano는 가장 작은 TTS 모델 중 하나이며, 모델 가중치 대비 놀라운 성능을 보여줘. 인증된 감자 컴퓨터(저사양 PC)를 가지고 있더라도 충분히 돌릴 수 있어.
SOTA(최첨단) 모델은 아니고, 거대 모델들을 이긴다고 주장하는 것도 아니야. 흥미로운 점은 크기 대비 기능 비율이지:
- 총 4.63M 추론 파라미터
- 3.46M 음향 모델
- 1.17M 보코더
- 24 kHz 오디오
- 영어 전용, 단일 남성 목소리
- 간단한 PyTorch 추론 스크립트로 로컬에서 실행 가능
비교하자면, Kokoro보다 약 17배 작고, Chatterbox보다 약 108배 작으며, Fish Audio S2 Pro보다는 거의 1000배 작아.
품질은 여전히 제한적이야. 로봇처럼 들릴 수 있고, 어렵거나 본 적 없는 텍스트에서 더듬거릴 수 있으며, 보코더도 큰 병목 현상이지. 하지만 총 5M 파라미터 미만이라는 점을 고려하면, 초소형 로컬 음성 합성, 오프라인 비서, 임베디드 기기, 브라우저/WASM 프로젝트, 로컬 음성 에이전트를 위한 흥미로운 기준점이 될 수 있다고 생각해.
모델: https://huggingface.co/owensong/Inflect-Nano-v1 (README에 오디오 예시 포함)
피드백을 환영해. 특히 초소형 모델, 로컬 음성 비서, 효율적인 추론, 혹은 작은 보코더에 관심 있는 사람들의 의견이 궁금해. 사람들이 유용하게 사용하고 모델이 성공적이라면, 훨씬 더 큰 학습 예산을 들여 v2를 만들 의향도 있어!

