Inflect v2 출시: 4M 및 10M 파라미터 미만의 초소형 완전체 TTS 모델
I released Inflect v2: two ultra-tiny complete TTS models under 4M and 10M parameters
핵심 요약
고등학생 개발자가 4M, 10M 파라미터 수준의 매우 가볍고 성능 좋은 로컬 TTS 모델 'Inflect v2'를 공개함.
- 초소형 TTS 모델 — 4M 및 10M 파라미터로 구성된 매우 가벼운 로컬 음성 합성 모델임.
- 성능 및 효율성 — 작은 크기에도 불구하고 실사용 가능한 수준의 음성 품질과 빠른 추론 속도를 제공함.
- 오픈 소스 공개 — Hugging Face와 GitHub를 통해 모델과 관련 문서를 누구나 테스트할 수 있도록 배포함.
- 향후 개선 계획 — 사용자 피드백을 바탕으로 다국어 지원 및 음성 클로닝 등 기능 확장을 고려 중임.
지난 한 달 동안 극도로 작은 TTS 모델이 단순한 사이즈 실험을 넘어 진짜 쓸만한 수준이 되는 지점을 찾으려고 개고생 좀 했다.
오늘 Inflect v2를 공개한다. 로컬에서 돌아가는 완전한 텍스트 음성 변환 모델 두 가지다.
- Inflect-Nano-v2: 3.96M 파라미터, 15.97 MB FP32
- Inflect-Micro-v2: 9.36M 파라미터, 37.53 MB FP32
이건 어쿠스틱 모델만 따진 게 아니라 전체 추론 파라미터 수다. 텍스트 처리, 타이밍 예측, 음성 생성, 파형 디코더까지 싹 다 포함된 수치임.
텍스트 넣으면 24 kHz 음성 튀어나온다. 외부 보코더, 호스팅 API, 혹은 추가 학습 모델 같은 거 필요 없다.
Nano는 무조건 용량 다이어트에 올인했고, Micro는 남는 용량 좀 써서 음질이랑 안정성을 챙겼다. 둘 다 PyTorch API로 CPU나 CUDA에서 로컬로 바로 돌릴 수 있다.
Inflect-Nano-v2는 내가 아는 한 진짜 실사용 가능한 음성을 뽑아내는 가장 작은 신경망 TTS 모델 중 하나일 거다. 9.36M짜리 Micro 모델조차도 "초소형"이라고 불리는 다른 시스템들보다 훨씬 작다.
용량 비교를 좀 해보자면, Nano는 대략 이 정도다:
- Kokoro보다 21배 작음
- Chatterbox보다 126배 작음
- Fish Audio S2 Pro보다 1,000배 이상 작음
이건 순수하게 파라미터 수만 비교한 거다. 모델마다 기능, 아키텍처, 데이터셋, 용도가 다 다르니까. 4M짜리 고정 음성 모델이 수십억 파라미터짜리 시스템을 대체한다고 말하는 건 아니다. 진짜 재밌는 건 이 쥐꼬리만한 사이즈에 얼마나 쓸만한 TTS를 구겨 넣을 수 있느냐는 거지.
지난달에 내가 올렸던 4.63M짜리 실험작 Inflect-Nano-v1 기억하는 사람 있을 거다. V2는 단순히 학습 좀 더 돌린 게 아니라 아예 갈아엎었다. V1에서 드러났던 문제들, 그러니까 불안정한 타이밍, 기계음 섞인 소리, 어색한 억양, 어려운 텍스트 처리 능력 부족, 파형 디코더 성능 저하 같은 것들을 잡는 데 집중했다.
결과물은 생각보다 훨씬 잘 나왔다:
- Micro: 4.395 UTMOS22, 3.99% 의미론적 WER, 6.28배 실시간 CPU 추론
- Nano: 4.386 UTMOS22, 4.21% 의미론적 WER, 10.72배 실시간 CPU 추론
- 다른 소형 TTS 시스템들과 블라인드 테스트를 해봤는데, Micro랑 Nano가 테스트한 음성들 중에서 2등, 3등 먹었다.
전체 프로토콜, 원본 결과, 오디오 샘플, 한계점 같은 건 모델 페이지에 다 적어놨다.
물론 완벽하진 않다. 영어만 되고, 고정된 남성 목소리 하나뿐이고, 음성 복제도 안 된다. 낯선 이름, 약어, 숫자, 동형이의어는 여전히 쥐약이다. Nano는 Micro보다 소리가 좀 얇게 들릴 수 있고, 둘 다 가끔 기계음이 섞이거나 소리가 씹히는 현상이 있다.


