AI Gateway에 실시간 오디오·음성 지원 기능이 추가됐습니다. Vercel AI Gateway에서 AI SDK를 활용해 저지연 실시간 음성 에이전트를 만들 수 있으며, 텍스트 음성 변환(TTS)과 음성 텍스트 변환(STT)도 하나의 API 키와 기존 도구로 간편하게 이용할 수 있습니다.
AI Gateway에 오디오·음성 지원이 추가됐습니다. 기존에 텍스트, 이미지, 영상 처리에 사용하던 것과 동일한 방식으로 실시간 음성, 텍스트 음성 변환(TTS), 음성 텍스트 변환(STT)을 호출할 수 있으며, 모든 모달리티가 AI Gateway를 통해 일원화됩니다.
오디오 기능은 OpenAI와 xAI 모델과 함께 출시됩니다. 기존 모델에서 사용하던 프로바이더 라우팅, 관찰 가능성(observability), 지출 제한, 자체 키 연동(bring-your-own-key) 기능을 그대로 활용할 수 있습니다.
해당 기능은 현재 베타 버전으로, AI SDK 7에서 이용할 수 있습니다.
기능 | 동작 방식 | 활용 사례 |
|---|---|---|
실시간 음성 | 스트리밍·저지연 세션을 위한 양방향 실시간 오디오 | 양방향 음성 에이전트 및 실시간 대화 |
텍스트 음성 변환(TTS) | 텍스트 입력, 오디오 파일 출력, 단일 요청 | 보이스오버, 음성 응답, 문서의 오디오 버전 변환 |
음성 텍스트 변환(STT) | 녹음 파일 입력, 텍스트 출력, 단일 요청 | 음성 메모 및 통화 녹음 전사 |
실시간 음성, TTS, 전사 모델은 AI SDK 7에서 지원됩니다.
실시간 기능을 활용하면 사용자가 직접 대화할 수 있는 앱을 만들 수 있습니다. 말을 건네면 모델이 즉시 응답하며, 전체 발화가 끝날 때까지 기다리지 않고 즉각 답하기 때문에 사람과 대화하듯 자연스럽게 끼어들거나 말을 끊을 수 있습니다. 음성 어시스턴트, 고객 지원 에이전트, 핸즈프리 도구 등 타이핑 대신 말로 소통하고 싶은 모든 상황에 적합합니다.
모델을 순차적으로 연결하는 방식(STT → 언어 모델 → TTS 파이프라인)과 달리, 단일 실시간 모델이 오디오를 직접 수신하고 오디오로 응답한다는 점이 핵심 차별점입니다.
브라우저 환경에서는 useRealtime 훅이 WebSocket 연결, 마이크 캡처, 오디오 재생을 모두 처리합니다.
연결은 AI Gateway 자격증명으로 인증되므로, 서버에서 단기 토큰을 발급해 브라우저에는 해당 토큰만 전달합니다. API 키는 클라이언트에 노출되지 않습니다. 토큰을 발급하는 라우트를 다음과 같이 추가하세요:
그런 다음 클라이언트 컴포넌트에서 연결합니다:
훅은 마이크를 캡처하고 AI Gateway를 통해 모델로 오디오를 스트리밍한 뒤 음성 응답을 재생합니다. 브라우저 외부 환경에서는 getWebSocketConfig, serializeClientEvent, parseServerEvent를 사용해 직접 WebSocket으로 세션을 제어할 수 있습니다. 자세한 방법은 실시간 레퍼런스를 참고하세요.
실시간 세션은 일반 모델 호출과 다르게 동작합니다:
발화 순서와 끼어들기. turnDetection: { type: 'server-vad' }를 통해 서버가 사용자의 발화 종료 시점을 판단하며, 클라이언트 측 침묵 타이머 없이도 사용자가 모델의 응답 도중 끼어들어(barge-in) 말을 끊을 수 있습니다.
대화 중 도구 호출. 모델이 응답 도중 도구 호출을 발생시키면, 실행 결과를 클라이언트 이벤트로 반환해 턴을 종료하지 않고 다음 발화에 자연스럽게 반영됩니다.
generateSpeech를 사용해 텍스트에서 음성 오디오를 생성합니다. 음성 종류와 출력 형식을 지정하고 결과를 파일로 저장합니다:
transcribe로 녹음 파일을 텍스트로 전사합니다. 오디오는 버퍼, base64 문자열, URL 형태로 전달할 수 있습니다:
TTS와 전사는 서로 보완적이라 함께 활용하기 좋습니다. 한 모델로 오디오를 생성하고 다른 모델로 다시 읽어들이면, 오디오 파이프라인의 양 끝을 빠르게 검증할 수 있습니다.
코드를 작성하지 않고도 오디오 모델을 직접 체험할 수 있습니다. 모델 페이지에서 원하는 모델을 선택하면 브라우저에서 바로 사용해볼 수 있습니다. 실시간 모델에 말을 걸어 음성 대화를 나눠보거나, TTS·전사 모델에 텍스트나 오디오를 입력해 결과를 확인해보세요.
AI Gateway에서 오디오 호출은 다른 모델 호출과 동일하게 동작합니다. 여러 프로바이더에 단일 API 키를 사용하고, 관찰 가능성에서 요청 및 사용량을 확인하며, 동일한 예산 및 지출 한도를 적용하고, 필요 시 자체 프로바이더 키를 연동할 수 있습니다. 이미 AI Gateway로 텍스트·이미지·영상을 처리 중인 앱이라면 음성 기능도 같은 곳에서 바로 추가할 수 있습니다.