AI 튜터링 시스템 구축 시 모델 선택보다 중요한 건 지연 시간(Latency)이다
Latency matters more than model selection when building AI tutoring systems
핵심 요약
AI 튜터링 시스템의 핵심은 모델 성능보다 응답 지연 시간을 줄여 학습 몰입도를 유지하는 것이다.
- 지연 시간 최적화 — 학습 몰입도를 위해 응답 속도를 1.5초 이내로 유지해야 함
- 파이프라인 개선 — ASR과 TTS 스트리밍 등 각 단계의 지연 시간을 줄이는 것이 필수적임
- 아바타 동기화 — 3D 아바타 사용 시 립싱크 지연이 발생하면 오히려 경험을 해칠 수 있음
- 모델보다 아키텍처 — 모델 성능 고민보다 스트리밍 TTS 등 아키텍처 최적화가 우선임
다들 AI 튜터링에 어떤 LLM을 쓸지 의견이 분분하다. GPT-4o냐, Claude냐, 아니면 파인튜닝한 오픈소스냐. 근데 이건 시작부터 잘못된 질문이다.
학생들의 몰입도를 유지하는 건 결국 응답 지연 시간이다. 특히 음성 응답 시작 지연 시간, 즉 학생이 말을 마친 후 음성 응답이 얼마나 빨리 나오느냐가 중요하다. 1.5초가 넘어가면 학생들은 집중력을 잃는다. 시스템이 멈췄다고 생각하기 때문이다. 일단 튜터링의 흐름이 깨지면 아무리 모델 성능이 좋아도 소용없다.
파이프라인은 ASR → 컨텍스트 조회 → LLM 호출 → TTS → 아바타 동기화 → 출력 순으로 진행된다. 모든 단계에서 시간이 소요되고, 이게 누적된다. 대부분의 팀이 LLM 단계에만 집착하는데, 실제로는 ASR과 TTS-아바타 동기화 단계에서 문제가 많이 발생한다.
Whisper가 ASR 정확도는 잘 잡지만, 스트리밍 환경에서는 지연 시간 문제를 신경 써야 한다. 여기에 립싱크가 포함된 3D 아바타까지 추가하면 렌더링 레이어가 하나 더 얹히는 셈이다. 이 지연 시간이 임계치를 넘으면, 응답이 느린 것보다 불쾌한 골짜기 효과 때문에 경험이 훨씬 빨리 망가진다.
프로덕션 시스템을 위한 목표치를 제시하자면, 음성 응답 시작 지연 시간 1초 미만, 전체 응답 2초 미만, 화이트보드나 공유 컨텍스트 동기화 500ms 미만이다. 충분히 달성 가능하지만, 각 레이어에서 의도적인 최적화 작업이 필요하다.
스트리밍 TTS가 아마 가장 효과가 클 것이다. LLM 응답이 다 올 때까지 기다리지 마라. 토큰이 들어오는 대로 오디오를 재생해라. 이것만으로도 체감 응답 속도를 1초는 줄일 수 있다. 아키텍처부터 제대로 잡아라. 모델이 뭐라고 할지는 그 다음에 고민해도 늦지 않다.


