Sopro V2 Turbo 2610: 더 깔끔해진 음성 복제, 동일한 120M 모델, 동일한 CPU 속도
Sopro V2 Turbo 2610: cleaner cloned voices, same 120M model, same CPU speed
핵심 요약
음성 복제 품질을 개선한 Sopro V2 Turbo 2610 업데이트가 공개되었습니다.
- 음성 품질 개선 — 기존 복제 시 발생하던 거친 소리와 끊김 현상을 줄임
- 성능 유지 — 120M 모델 크기와 CPU 기반의 빠른 속도를 그대로 유지함
- 오픈 소스 — Apache-2.0 라이선스로 배포됨
- 향후 계획 — 더 많은 언어 지원과 생성 음성에 대한 제어 기능 추가 예정
huggingface.co
원문 사이트로 이동
지난달 올린 글 후속이야. 사람들이 음성 복제할 때 목소리가 거칠게 나오거나 깨지는 현상을 많이 겪었거든. 이번 2610 업데이트는 주로 그 부분 개선하는 데 집중했어.
-
기존에 문제 있던 목소리들 거칠기랑 깨짐 현상 줄임
-
120M 모델 그대로고, 속도도 똑같음 (노트북 CPU 기준 첫 오디오 출력까지 약 300ms)
-
Apache-2.0 라이선스
-
영어, 유럽 포르투갈어, 프랑스어, 독일어 지원
-
지원 언어 더 늘릴 예정
-
생성되는 목소리 제어 기능도 추가할 계획
-
여전히 하이톤이나 만화 같은 목소리, 노이즈 섞인 레퍼런스 오디오, 좀 특이한 OOD(Out-of-Distribution) 목소리는 잘 안 됨. 이 부분은 계속 개선 중이야. 혹시 기여하고 싶으면 잘 안 된 샘플들 나한테 개인 메시지로 보내줘.
F5-TTS는 좋은데, 진짜 스트리밍 기능이 필요하고 CPU에서도 쾌적하게 돌아가는 가벼운 모델을 찾고 있다면 이게 딱일 거야.
로컬에서 돌리는 법:
uvx --from sopro soprotts serve
-
브라우저 데모 (데스크톱): https://samuel-vitorino.github.io/sopro/
-
Space: https://huggingface.co/spaces/samuel-vitorino/sopro-v2-turbo-tts
-
블로그 (평가, 샘플, 작동 원리): https://research.haloneuro.ai/posts/sopro-v2
영상: 목소리 6개, 각각 5초 정도의 레퍼런스 오디오 뒤에 생성된 문장이 이어짐.
.buffering-track-fill { stroke-dasharray: 100; stroke-dashoffset: 50; }


