Scenema Audio: 제로샷 표현력 있는 음성 복제 및 음성 생성 모델 공개
Scenema Audio: Zero-shot expressive voice cloning and speech generation
핵심 요약
감정과 음성 정체성을 분리하여 자연스러운 감정 표현이 가능한 제로샷 음성 생성 모델 Scenema Audio가 공개되었습니다.
- 감정 분리 기술 — 음성 정체성과 감정 표현을 독립적으로 제어하여 어떤 목소리로든 원하는 감정을 연기할 수 있음
- 확산 모델 기반 — 기존 TTS와 달리 자연스러운 감정 전달이 가능하며, 생성 후 편집 워크플로우에 최적화됨
- 오디오 우선 워크플로우 — 생성된 음성을 기반으로 LTX 2.3 등 비디오 생성 모델과 연동하여 영상 제작 가능
- 배포 편의성 — Docker 컨테이너와 REST API를 통해 GPU 사양별로 자동 최적화된 환경을 제공함
저희는 scenema.ai의 영상 제작 플랫폼의 일환으로 Scenema Audio를 구축해 왔으며, 이제 모델 가중치와 추론 코드를 공개합니다.
핵심 아이디어는 감정적 연기와 음성 정체성이 독립적이라는 것입니다. 음성이 어떻게 표현되어야 하는지(분노, 슬픔, 흥분, 아이의 경이로움 등)를 설명하고, 선택적으로 음성 정체성을 위한 참조 오디오를 제공합니다. 참조 오디오는 '누구'를 결정하고, 프롬프트는 '어떻게'를 결정합니다. 어떤 목소리든 그 목소리가 이전에 해당 감정 상태로 녹음된 적이 없더라도 어떤 감정이든 표현할 수 있습니다.
한계점 (그리고 우리가 여전히 사용하는 이유)
이것은 전통적인 TTS 파이프라인이 아닌 확산 모델입니다. 흔한 문제로는 일부 시드에서 반복되거나 의미 없는 소리가 생성되는 경우가 있습니다. 시드마다 결과가 다르며, 0% 오류율로 완벽한 출력을 얻을 수는 없습니다. 이 모델은 생성하고, 가장 좋은 테이크를 선택하고, 필요하면 다듬는 식의 후편집 워크플로우를 위해 만들어졌습니다. 다른 생성 모델을 사용할 때와 같은 방식입니다.
그럼에도 불구하고, 우리는 이미 시중의 대부분의 TTS 시스템보다 제어하기 쉬운 Gemini 3.1 Flash TTS보다도 Scenema Audio를 계속 찾게 됩니다. 이유는 간단합니다. 결과물이 훨씬 자연스럽고 로봇 같지 않기 때문입니다. 확산 모델로 생성된 음성에는 자기회귀(autoregressive) 방식의 TTS가 따라올 수 없는, 특히 감정 전달에 있어서의 독특한 품질이 있습니다.
오디오 우선 비디오 생성

이 영상

해당 워크플로우의 실제 예시는 여기에서 볼 수 있습니다.
증류(Distillation)와 속도에 대하여
몇몇 분들이 질문해주셨는데, 저희의 병목 현상은 노이즈 제거 단계가 아닙니다. 확산 과정은 전체 생성 시간의 작은 부분일 뿐입니다. 실제 비용은 파이프라인의 다른 곳에서 발생합니다. 저희는 이미 8단계(기본 모델의 50단계에서 감소)에 도달했으며, 이는 품질이 유지되는 최적의 지점입니다.
프롬프트의 중요성
이 모델은 LTX 2.3이 비디오에서 그렇듯 프롬프트에 민감합니다. 일반적인 음성 설명은 일반적인 결과를 줍니다. 행동 태그가 포함된 구체적이고 연극적인 설명은 실제 연기를 만들어냅니다. 또한 모델이 단어당 할당받는 시간을 제어하는 pace 매개변수도 있습니다. 사용 사례에 맞는 설정을 찾기까지 약간의 실험이 필요하지만, 일단 찾고 나면 품질 저하를 최소화하면서 몇 시간 분량의 오디오를 생성할 수 있습니다.
복잡한 단어나 고유 명사는 음성 표기법(phonetic spelling)을 사용하는 것이 좋습니다. 전통적인 TTS와 달리 음소-오디오 파이프라인이나 발음 사전이 없기 때문입니다. 만약 "Tchaikovsky"를 제대로 발음하지 못한다면, "Chai-koff-skee"와 같이 본인에게 이해하기 쉬운 방식으로 표기하면 됩니다.



