구글, 새로운 음성 인식 모델 'Gemini 3.5 Transcribe' 출시
Google just released its new speech-to-text model, Gemini 3.5 Transcribe.
핵심 요약
구글이 소음 제거와 다국어 처리에 특화된 음성 인식 모델 'Gemini 3.5 Transcribe'를 공개했습니다.
- 성능 향상 — 소음 환경에서도 정확한 전사 및 다국어 전환 지원
- 데이터 처리 — 전화번호, 우편번호 등 복잡한 정보 인식 능력 강화
- 자동 편집 — 불필요한 추임새 제거 및 문장 부호 자동 삽입
- 사용자 정의 — 특정 용어 사전 등록 및 맞춤형 어휘 지원
공식 데모들 좀 확인해 봤는데, 몇 가지 눈에 띄는 점들이 있더라:
-
시끄러운 환경에서도 음성 인식 정확도가 꽤 높음.
-
언어 간 전환이 매끄럽고 85개 언어를 지원함.
-
전화번호, 우편번호, 주문 번호 같은 까다로운 정보 인식 능력이 더 좋아짐.
-
추임새 같은 불필요한 말은 알아서 걸러주고, 문장 부호랑 서식까지 자동으로 잡아줌.
-
커스텀 어휘 사전도 지원함.
이거 또 스타트업들 줄초상 나는 거 아니냐?

