수천 건의 AI 전화 상담 품질 관리(QA)는 어떻게 하시나요?
How do you QA thousands of AI phone calls?
핵심 요약
수천 건의 자동화된 AI 전화 상담에서 발생하는 복잡한 품질 관리 문제와 해결 방안을 논의합니다.
- QA 한계점 — 기존의 샘플링 방식으로는 백엔드 오류나 맥락 누락을 잡아내기 어려움
- 검증 시스템 검증 — QA 도구 자체가 제대로 작동하는지 의도적으로 오류를 넣어 테스트해야 함
- 실패 모드 중심 — 잘못된 필드 업데이트나 맥락 없는 이관 등 구체적인 실패 사례를 기준으로 QA 구축
- LLM 심사관 — 모든 상담 기록과 시스템 로그를 100% 감사하는 LLM 기반 자동화 시스템 도입
사람들이 자동화된 콜센터 운영에 대해 얘기할 때 잘 언급하지 않는 게 하나 있어.
그런데 수천 건의 자동화된 통화를 처리하게 되면 QA는 도대체 어떻게 되는 걸까?
기존의 QA는 이미 사람 상담원의 통화 중 극히 일부만 샘플링해서 확인하잖아. AI 콜센터 QA에서도 똑같이 또 다른 극히 일부를 무작위로 들어보는 게 과연 충분한 정보를 줄지 의문이야.
통화 스크립트상으로는 아무 문제 없어 보여도, 실제로는 내부적으로 뭔가 잘못 돌아가고 있을 수 있거든.
계정 상태가 잘못 설정됐거나, 엉뚱한 툴이 호출됐거나, 고객이 의도를 분명히 밝혔는데도 시스템은 이전 답변을 그대로 기록하고 있거나, 아니면 고객을 상담원에게 연결했는데 정작 상담원은 이전 상황을 전혀 모르는 경우 같은 것들 말이야.
음성 AI 모니터링을 할 때는 도대체 뭘 어떻게 검토해야 하는 걸까?

