커스텀 보이스 스택 vs 플랫폼? STT 제어권에 따라 결정해야 함
Custom voice stack or platform ? I'd decide based on how much control I need over STT.
핵심 요약
음성 에이전트 개발 시 초기에는 플랫폼을 사용해 검증하고, STT 제어권이 필요한 시점에 커스텀 인프라로 전환하라는 조언입니다.
- 초기 검증 단계 — 플랫폼을 사용하여 시장 적합성과 워크플로우를 빠르게 확인함
- 커스텀 전환 시점 — 블랙박스 형태의 플랫폼에서 발생하는 오류와 제어 한계가 드러날 때
- 제어권 확보 — Pipecat 등을 활용해 STT 레이어, 지연 시간, 데이터 기록 등을 직접 관리함
- 의사결정 기준 — 기술적 구현 가능성보다 STT 이벤트와 작업 정확도에 대한 통제 필요성으로 판단함
모든 음성 에이전트 팀이 커스텀 인프라를 구축해야 한다고 생각하지 않습니다.
대부분은 그러면 안 됩니다.
검증 단계라면:
- 누군가 이걸 원하는가?
- 사람들이 전화를 받을 것인가?
- 워크플로우가 성사되는가?
- 이 버티컬이 가치가 있는가?
그렇다면 플랫폼을 사용하고 빠르게 넘어가세요.
하지만 통화가 이상한 방식으로 실패하기 시작하면, 블랙박스는 고통스러워집니다.
실패 사례 예시:
- 대시보드상의 전사는 괜찮아 보이는데 사용자가 불만을 제기함
- 에이전트가 수정된 번호를 놓침
- 원시 부분 이벤트(raw partial events)를 사용할 수 없음
- 엔드포인팅을 검사할 수 없음
- 끼어들기 처리를 튜닝할 수 없음
- 데이터 삭제(redaction)를 제어할 수 없음
- 통화 유형에 따라 STT를 교체할 수 없음
- 지연 시간이 STT, LLM, TTS, 도구 호출 중 어디서 발생하는지 알 수 없음
- 불안정한 전사를 기반으로 CRM 액션이 실행됨
그때가 제가 커스텀을 고려할 시점입니다.
커스텀이 더 멋져서가 아닙니다.
듣는 레이어(listening layer)에 대한 제어권을 원하기 때문입니다.
Pipecat + Supabase 스타일의 설정은 직접 관리해야 할 배관이 더 많아지지만, 다음과 같은 선택을 할 수 있습니다:
- 실시간 STT를 위해 Smallest AI Pulse 사용
- 전사 이벤트를 직접 저장
- 신뢰도가 낮은 통화는 사람의 검토로 라우팅
- 중요한 필드는 확인 절차 요구
- 모든 턴을 기록
- STT 동작별로 통화 결과 비교
- 실제 사용자를 기반으로 평가(evals) 구축
저에게 플랫폼 vs 커스텀 질문은 "내가 이걸 만들 수 있는가?"가 아닙니다. "STT 이벤트, 지연 시간, 데이터 삭제, 작업 정확도에 대해 '이 엉망진창인 상황을 직접 감당할 만큼'의 제어권이 필요한가?"입니다. 여러분은 어디에 선을 긋나요?


