지금 실무용 AI 음성 에이전트에 어떤 STT/LLM/TTS 스택 쓰고 계신가요?
What STT/LLM/TTS stack are you using for production voice agents right now?
핵심 요약
실무 환경에서 AI 음성 에이전트를 구축할 때 사용하는 기술 스택과 지연 시간 최적화에 대한 논의.
- 기술 스택 구성 — 실무용 음성 에이전트의 STT, LLM, TTS 조합 공유.
- 지연 시간 최적화 — LLM보다 STT와 엔드포인팅 단계의 병목 현상 해결이 중요함.
- 실전 테스트 — 브라우저 마이크가 아닌 실제 전화 환경에서의 성능 검증 필요.
- 인터럽트 처리 — 사용자 개입(barge-in) 시 즉각적인 반응 속도가 에이전트의 자연스러움을 결정함.
지금 실무용 AI 음성 에이전트에 실제로 어떤 스택을 쓰고 있는지 궁금함.
데모 영상 말고, "브라우저 마이크로 한 번 성공해 본" 거 말고. 실제 통화, 실제 사용자, 인터럽트, 안 좋은 마이크, 배경 소음, CRM/툴 호출 등등.
내가 계속 보는 스택은 대충 이런 식임:
- Twilio / Telnyx / LiveKit (오디오용)
- Deepgram / AssemblyAI / Whisper / Smallest AI Pulse / Speechmatics (STT용)
- OpenAI / Claude / Gemini (두뇌용)
- ElevenLabs / Cartesia / PlayHT / Deepgram Aura (TTS용)
- Vapi / Retell / Pipecat / LiveKit Agents (직접 오케스트레이션 안 할 경우)
지금 고민인 건 어디를 먼저 최적화해야 할지임.
다들 "더 빠른 LLM을 써라"라고 하지만, 내 테스트에서는 LLM이 제대로 된 전사(transcript)를 받기도 전에 어색한 지연 시간이 시작되는 경우가 많음.
현재 내 로깅 계획:
- 사용자 말하기 시작
- 첫 STT 부분 전사
- 최종 STT 전사
- LLM 첫 토큰
- 툴 호출 시간
- TTS 첫 오디오
- 오디오 재생 시작
- 인터럽트(barge-in) 감지
- 에이전트 말하기 중단
특히 STT는 Deepgram, AssemblyAI, Smallest AI Pulse, Speechmatics, Soniox, OpenAI realtime/transcribe 모델을 보고 있음.
지금 어떤 게 잘 작동함? 그리고 어디서 막히고 있음?

