음성 에이전트용 TTS로 다들 뭐 쓰시나요? 지연 시간 때문에 미치겠네요
What are you actually using for TTS on voice agents? The latency is killing me
핵심 요약
음성 에이전트 개발 시 자연스러움보다 지연 시간(latency)과 일관성이 중요하며, 이를 해결하기 위한 TTS 솔루션과 테스트 방법을 논의함.
- 지연 시간 최적화 — 자연스러운 음질보다 TTFB와 일관된 응답 속도가 에이전트 성능의 핵심임.
- 테스트 환경 구축 — 단일 요청이 아닌 실제 동시 접속 환경과 대화형 길이의 텍스트로 테스트해야 함.
- 비용 효율성 고려 — 호출량이 늘어날 때의 비용 구조를 미리 모델링하여 예산 문제를 방지해야 함.
- TTS 솔루션 비교 — Cartesia, Deepgram Aura, ElevenLabs 등 주요 서비스의 실시간 성능을 검증함.
음성 에이전트(인바운드 지원 + 아웃바운드 자격 확인, 영어 및 스페인어)를 구축 중인데, TTS 레이어가 가장 고민거리가 되었습니다. 쉬울 줄 알았는데 짜증 나네요.
LLM 부분은 괜찮습니다. 분명히 말하지만 STT도 절대 "쉽지" 않습니다. 소음, 억양, 끼어들기, 나쁜 전화 음질, 웅얼거림 등 그 자체로 악몽이죠. 그 레이어를 폄하하는 건 아닙니다.
하지만 음성이 잘 캡처되고 LLM이 괜찮은 응답을 준비했다면, 전체 경험을 결정짓는 다음 요소는 에이전트가 얼마나 빨리 대답을 시작하느냐입니다. 음성이 나오기 전 그 짧은 공백은 치명적입니다.
모든 TTS 비교 자료를 보면 유튜버들이 "이 내레이션이 얼마나 자연스러운지 들어보세요"라고 하는데, 저는 그게 문제가 아닙니다. 제 문제는 발신자가 전화가 끊긴 줄 알기 전에 에이전트가 말을 시작해야 한다는 겁니다. 자연스러움도 중요하지만, 저는 빠르고 일관성 있고 적당히 괜찮은 순서로 필요합니다.
고려 중인 것들: ElevenLabs, Deepgram, Murf AI, Cartesia, OpenAI TTS 등 잊어버린 다른 것들도 있겠죠.
제가 진짜 신경 쓰는 것들:
- 낮은 TTFB(솔직히 제 고민의 80%입니다)
- 진짜 스트리밍(청크 단위 배치 처리가 아닌 것)
- 호출량이 늘어났을 때의 비용 효율성
- 다국어 지원, 특히 코드 믹싱(단순히 "스페인어 지원" 수준이 아님)
- 적당히 괜찮은 음성. 그냥 적당하면 됩니다. 상 받을 필요는 없어요.
다들 프로덕션이나 최소한 진지한 테스트에서 뭘 쓰고 계신가요? 전체 파이프라인을 다 짜놨는데 트래픽이 몰릴 때마다 600ms씩 튀는 걸 나중에 발견하고 싶지 않네요.
