음성 에이전트를 위한 최고의 STT API는? 정확도보다 지연 시간을 먼저 테스트해야 함
Best STT API for voice agents? I’d test latency before accuracy
핵심 요약
음성 에이전트 개발 시 정확도보다 지연 시간과 실시간 반응성이 사용자 경험에 훨씬 더 중요하다는 의견.
- STT 평가 기준 — 정확도보다 지연 시간과 반응 속도가 중요함
- 사용자 경험 — 잦은 멈춤이나 늦은 응답이 신뢰도를 떨어뜨림
- 테스트 방법론 — LiveKit과 Langfuse를 활용한 실시간 로그 분석
- 핵심 지표 — 첫 사용 가능 텍스트 도달 시간과 중단 처리 능력
예전에는 "음성 에이전트를 위한 최고의 STT"라는 질문이 다음을 의미한다고 생각했음:
어떤 것이 가장 정확한 전사(transcription)를 제공하는가?
이제는 그렇게 생각하지 않음.
실시간 에이전트의 경우, 대본이 기술적으로는 정확할지 몰라도 너무 늦게 도착하거나 계속 내용이 바뀌면 통화 경험을 망치게 됨.
사용자는 당신의 WER(단어 오류율)이 좋은지 따위엔 관심이 없음.
사용자가 느끼는 건 이런 것들임:
"왜 봇이 멈추지?"
"왜 내가 말을 끝내기도 전에 대답하지?"
"왜 내가 수정한 숫자를 놓치지?"
"왜 내 말을 가로채지?"
그래서 내 현재 테스트는 "어떤 STT가 가장 정확한가?"보다는 다음 질문에 가까움:
에이전트의 나머지 부분이 텍스트를 안전하게 사용할 만큼 충분히 빠른가?
나는 모든 턴(turn)을 기록하는 LiveKit + Langfuse 설정을 시도 중임:
사용자가 말을 시작함
첫 번째 대본 조각
사용 가능한 대본
LLM 시작
도구 호출
음성 시작
사용자가 말을 가로챔
에이전트가 입을 다묾
Smallest AI Pulse가 내 후보 목록에 있는 이유는 명확함: 이걸 파일 전사 도구처럼 평가하고 싶지 않기 때문임. 나는 이게 음성 에이전트를 위한 실시간 듣기 레이어처럼 작동하는지 확인하고 싶음.
이 사용 사례에 대해 내 점수표는 다음과 같음:
- first usable text
- final transcript delay
- partial rewrite chaos
- endpointing
- barge-in behavior
- phone audio
- names/numbers/dates
- p95 turn latency
물론 정확도도 중요함.
하지만 음성 에이전트의 경우, 지연 시간이 전체 시스템을 살아있는 것처럼 느끼게 할지 아니면 가짜처럼 느끼게 할지를 결정함.
혹시 이런 방식으로 STT를 측정하고 있는 사람 또 있음?


