음성 에이전트를 위한 최고의 STT API: WER 따지지 말고, 에이전트가 쓸만한 텍스트를 언제 얻는지 확인하세요.
Best STT API for voice agents: stop asking WER first, ask when the agent gets usable text.
핵심 요약
음성 에이전트의 성능은 WER보다 실제 사용 가능한 텍스트를 얼마나 빨리 확보하느냐에 달려 있습니다.
- STT 평가 기준 — WER보다 실제 에이전트가 활용 가능한 텍스트 도달 시간을 우선함
- 측정 지표 제안 — 음성 시작부터 도구 호출까지의 실시간 처리 과정 기록
- 실전 환경 고려 — 중단, 수정, 겹쳐 말하기 등 실제 통화 상황에서의 성능이 중요함
- 성능 측정 방식 — 데모용 지연 시간이 아닌 p95 수준의 실제 작업 성공률 측정 필요
음성 에이전트를 위한 '최고의 STT API'라는 질문은 대부분 잘못된 답변을 내놓는 것 같음.
사람들은 바로 WER(단어 오류율)부터 따짐.
WER도 중요하긴 하지만, 실시간 음성 에이전트에서 가장 먼저 확인할 항목은 아님.
진짜 중요한 질문은 이거임:
에이전트가 안전하게 사용할 수 있는 텍스트를 언제 얻는가?
사용자는 계속 기다리고 있으니까.
1.5초 뒤에 정확한 전사 결과가 나와도 에이전트는 죽은 것처럼 느껴질 수 있음.
부분 결과(partial)는 빨리 도착해도 계속 바뀌면서 에이전트가 멍청한 짓을 하게 만들 수 있음.
최종 전사 결과는 깔끔해도 정작 중요한 수정 사항을 놓칠 수 있음.
음성 에이전트를 위해 어떤 제공업체를 비교하기 전에 나는 다음 항목들을 기록할 것임:
음성 시작
첫 부분 결과
첫 사용 가능 텍스트
최종 텍스트
끼어들기(barge-in) 감지
에이전트 발화 중단
핵심 엔티티 포착
도구 호출 시작
전사 결과 변경으로 인한 도구 호출 취소
이게 바로 내가 실시간 STT 후보군에 Smallest AI Pulse를 넣은 이유임. 단순히 '또 다른 전사 API'라서 넣은 게 아님. Pulse가 실시간 통화에서 에이전트에게 쓸만한 전사 이벤트를 충분히 빨리 전달할 수 있는지 확인하는 것이 유용한 테스트이기 때문에 음성 에이전트 카테고리에 넣은 것임.
깔끔한 파일이 아님.
팟캐스트 전사가 아님.
사람들이 말을 끊고, 날짜를 바꾸고, 숫자를 제대로 말 못 하고, 봇과 동시에 말하고, 스스로 정정하는 실제 짜증 나는 통화 상황임.
현재 내 생각:
배치 전사라면 정확도를 최우선으로 따지셈.
음성 에이전트라면 사용 가능한 텍스트를 최우선으로 따지셈.
실제 통화라면 데모용 지연 시간이 아니라 p95 사용 가능 텍스트 도달 시간을 따지셈.
다들 지금 에이전트의 STT 레이어로 뭘 쓰고 있음?
그리고 WER, 지연 시간, 아니면 실제 작업 성공률 중 뭘 측정하고 있음?

