LTX-2.3 기반 오디오 모델 출력 결과
LTX-2.3 based audio model outputs
핵심 요약
LTX-2.3 모델을 활용해 다양한 캐릭터의 음성을 생성하고 VRAM 최적화 실험 결과를 공유함.
- 오디오 생성 — 악당, 탐정, 토크쇼 진행자, 액션 영웅 등 다양한 캐릭터 음성 생성
- 연속 청킹 — 더 긴 오디오 생성을 위한 연속 청킹 방식 실험
- VRAM 최적화 — Gemma 모델 오프로딩 시 8GB, 전체 메모리 상주 시 21GB VRAM 사용
- 추론 속도 — 메모리 상주 시 추론 속도가 크게 향상됨
악당의 사악한 웃음
프롬프트: 굵은 목소리의 악당이 연극적인 위협을 담아 말한다. 처음에는 부드럽게 낄낄거린다. "헤헤헤. 하하하하하하하! 오, 용서해라, 용서해." 사악한 미소를 지으며 숨을 고르고 목을 가다듬는다. "그들이 발버둥 치는 걸 보는 건 정말이지 너무 재밌지 않나?" 경멸이 뚝뚝 묻어나는 목소리로 말한다. "너한테는 더 많은 걸 기대했는데, 정말 그랬어. 얼마나 실망스러운지." 가까이 다가와 악의적인 강도로 속삭인다. "하지만 두려워 마라, 나의 사랑하는 이여. 진짜 재미는 이제 막 시작되었을 뿐이니까." 마지막으로 한 번 더 낄낄거린다. "헤헤헤."
거친 탐정 (느와르)
프롬프트: 거친 탐정이 낮고 쉰 목소리로 말한다. 담배를 길게 한 모금 빨고 천천히 내뱉는다. "이 도시는 사람들을 산 채로 잡아먹고, 씹어 삼키고, 뱉어내지." 기침을 한다, 깊고 덜컹거리는 기침이다. "헤, 이런 것들이 범죄자들보다 훨씬 먼저 나를 죽일 거야." 지친 듯 한숨을 쉰다. "이 부서에서 20년을 일했어. 20년 동안 선하고 괜찮은 사람들이 타락하는 걸 지켜봤지." 어둡게 낄낄거린다. "재밌는 게 뭔지 아나? 그 어떤 것도 재미있는 건 없다는 거야, 빌어먹을." 목을 가다듬는다. "자, 가자고. 할 일이 있으니까."
토크쇼 진행자 (통제 불가능한 웃음)
프롬프트: 토크쇼 진행자가 생동감 넘치는 열정으로 말한다. 과장된 충격으로 헉 소리를 낸다. "아니! 방금 그 말 한 거 아니지, 안 했다고 말해줘!" 통제할 수 없는 웃음을 터뜨린다. "하하하! 오 세상에, 오 세상에!" 쌕쌕거리며 겨우 말을 잇는다. "못하겠어, 지금 숨을 쉴 수가 없어!" 눈물을 닦으며 훌쩍인다. "오, 그거 정말 좋다, 진짜 진심으로 좋아." 행복하게 한숨을 쉰다. "아, 알았어 알았어, 진정하자, 난 프로니까." 한 번 숨을 들이마시고는 바로 다시 웃음을 터뜨린다. "풋, 헤헤헤, 아니 절대 못 하겠어, 다들 정말 미안해요!" 박수를 친다. "여러분, 바로 이거, 제가 제 일을 사랑하는 이유입니다!"
액션 영웅 (승리의 헐떡임)
프롬프트: 근육질 남자가 굵은 억양으로 말하며 거칠게 헐떡인다. 완전히 숨이 찬 상태다. "하... 하... 해냈어, 우리가 진짜 해냈다고." 거칠게 기침한다. "으, 내 인생에서 가장 힘든 싸움이었어, 맹세해." 신음하며 옆구리를 움켜쥔다. "아, 내 갈비뼈, 뭔가 부러진 것 같아." 하지만 고통에도 불구하고 미소가 번지며 호탕하게 웃는다. "하하하! 하지만 우리가 이겼잖아! 믿겨져? 우리가 진짜 이겼다고!" 떨리는 숨을 깊게 들이마신다. "말했잖아, 헤, 우리가 해낼 거라고 말했지. 아, 드디어 끝났어."
안정적인 출력으로 45초 분량.
더 긴 청크를 처리할 수 있도록 연속 청킹을 실험 중입니다.
피크 VRAM 사용량은 Gemma 모델을 오프로딩할 때 약 8GB이고, 모든 것을 메모리에 유지하면 약 21GB의 VRAM을 사용하지만 추론 속도가 크게 향상됩니다.


