21개 GPU의 소형 TTS 모델(VRAM 5GB) 벤치마크 결과
21 GPU's benchmarked running a small TTS model (vram peak: 5GB)
핵심 요약
다양한 소비자용 GPU를 활용해 소형 TTS 모델인 OmniVoice의 성능을 비교 분석함.
- 벤치마크 대상 — 21개의 다양한 소비자용 GPU를 활용해 소형 TTS 모델 OmniVoice의 성능을 측정함.
- VRAM 요구량 — 모델 실행 시 최대 5GB의 VRAM을 점유하는 환경에서 테스트를 진행함.
- 성능 지표 — 실시간 대비 생성 속도인 xRT를 기준으로 각 GPU의 상대적 성능을 비교함.
- 비교 기준 — 작성자의 RTX 3090을 기준으로 삼아 여러 GPU의 성능 차이를 확인하고자 함.
vast.ai에서 여러 GPU를 몇 분씩 대여해 VRAM 사용량이 최대 5GB인 소형 TTS 모델, OmniVoice를 벤치마크했습니다. 제 RTX 3090과 비교했을 때 다양한 소비자용 GPU들이 어느 정도의 성능을 보여줄지 확인하고 싶었습니다.
이것은 결코 광범위하거나 과학적인 분석은 아니지만, 각 GPU의 상대적인 성능을 대략적으로 파악하는 데 도움이 될 것이라 생각합니다.
xRT는 실시간 대비 배수를 의미합니다. GPU가 실시간보다 얼마나 더 빠르게 오디오를 생성하는지 보여줍니다. 제공된 참조 오디오(음성 복제)를 사용하여 짧은 문단을 3회 실행한 평균값입니다.

