음성 에이전트가 똑똑해 보였는데, 전화번호 하나 잘못 받아쓰는 순간 망했음
My voice agent sounded smart until one phone number was transcribed wrong.
핵심 요약
음성 에이전트의 성능은 일반적인 받아쓰기 정확도가 아니라, 워크플로우에 결정적인 핵심 정보들을 얼마나 정확히 처리하느냐로 평가해야 합니다.
- STT 평가 기준 — 일반적인 받아쓰기 정확도가 아닌 워크플로우 핵심 정보 처리 능력에 집중함
- 핵심 엔티티 — 전화번호, 날짜, 부정어 등 행동을 결정짓는 단어들의 정확도가 중요함
- 평가 방식 개선 — 단순 WER(단어 오류율)이 아닌 CRM 필드 일치 여부로 성능을 측정함
- 벤치마크 제안 — AI 음성 에이전트만을 위한 별도의 엔티티 정확도 벤치마크가 필요함
에이전트 성능은 좋았음.
자연스러운 목소리. 좋은 프롬프트. 훌륭한 핸드오프 로직. CRM 업데이트도 잘 작동했고, 캘린더 연동도 문제없었음.
그런데 전화번호 하나를 잘못 알아듣는 순간, 모든 게 쓸모없어졌음.
그때 깨달았지. 음성 에이전트의 STT는 일반적인 받아쓰기처럼 평가하면 안 된다는 걸.
전사 내용이 "대체로 정확"해도 워크플로우는 실패할 수 있음.
음성 에이전트에게는 나머지 단어들보다 다음 단어들이 훨씬 중요함:
- 전화번호
- 약속 시간
- 날짜
- 이름
- 이메일 주소
- 가격
- 주소
- 주문 ID
- "안 해(don’t)"
- "아니(not)"
- "사실은(actually)"
- "잠시만(wait)"
- "아니, 내 말은…(no, I meant…)"
이런 단어들이 행동을 결정짓는 핵심임.
그래서 지금은 단순히 전사 정확도가 아니라 HubSpot 필드를 기준으로 테스트 중임.
예시 스코어카드:
- 전화번호 필드가 일치하는가?
- 약속 날짜가 일치하는가?
- 에이전트가 정정 내용을 알아들었는가?
- 확인 절차를 거쳤는가?
- 확인 후에만 CRM이 업데이트되었는가?
- 전사 내용이 부정어를 제대로 보존했는가?
Smallest AI Pulse가 흥미로운 이유는 "좋은 전사문을 작성할 수 있는가?"가 아니라, 실시간 STT 레이어가 통화 중에 워크플로우에 결정적인 엔티티를 포착할 수 있는지를 평가하기 때문임.
AI 음성 에이전트의 경우, 엔티티 정확도는 별도의 벤치마크가 필요하다고 생각함.
WER(단어 오류율)이 아님.
그냥 느낌(vibes)도 아님.
시스템이 중요한 필드들을 제대로 포착했는가? 이게 핵심임.

