sanoTTS 출시: 3달러짜리 마이크로컨트롤러에서 돌아가는 294k 파라미터(337KB)의 초소형 TTS 스택
I released sanoTTS: smallest complete TTS stack in 294k params (337 KB) that runs on $3 microcontroller and a 1.46m one that beats models 3x and 10x it's size
핵심 요약
3달러짜리 마이크로컨트롤러에서도 구동 가능한 초경량 고성능 TTS 모델 sanoTTS가 공개되어 큰 관심을 받고 있습니다.
- 초경량 모델 — 294k 파라미터로 337KB 용량 구현
- 뛰어난 성능 — 1.5m 모델이 훨씬 큰 기존 모델들을 능가
- IoT 최적화 — ESP32 등 저사양 하드웨어에서 실시간 구동 가능
- 오픈 소스 — 깃허브를 통해 코드와 논문 공개
NPU도 없는 512kb SRAM짜리 3달러짜리 칩에서 돌아갈 정도로 TTS 스택을 극한까지 다이어트해봤다. 그 목표를 달성하려고 만든 게 바로 sanoTTS인데, 특징은 다음과 같다.
-
11개 목소리, 6개 언어 지원
-
파라미터 크기 294k ~ 2.2m. 비교하자면 kokoro보다 1000배, voxtral TTS보다는 9000배 작음
-
1.5m 모델 기준 SCOREQ 4.13, UTMOS 4.10 찍음
-
int8로 양자화하면 294k 모델은 337kb밖에 안 됨
-
웹 어셈블리로 웹사이트에서도 돌릴 수 있음
npm install sanotts-web -
언어나 목소리 더 추가하고 싶으면 따라 할 수 있는 레시피도 있음
자신 있게 말하는데, 이번 릴리즈에 포함된 모델이 whisper 기준 WER 약 2%로 현존하는 가장 작은 신경망 TTS 모델이다.
여기서 확인해봐: https://github.com/ampixa/sanoTTS
라이브 데모: https://tts.ampixa.com/sanoTTS
HF: https://huggingface.co/ampixa/sanoTTS
SCOREQ 점수 보면 sanoTTS-Amy(1.51m)가 Inflect Nano(4.63m)나 KittenTTS(15m)보다 성능 좋음 (4.13 vs 3.81 vs 3.02)
esp32 마이크로컨트롤러에서 RTF 0.225 나오는데, 쉽게 말해서 4초짜리 오디오를 1초 만에 뽑아낸다는 소리임.
궁금한 거 있으면 다 물어봐라.



