ai-sage/GigaChat3.1-Audio-10B-A1.8B · 허깅페이스
ai-sage/GigaChat3.1-Audio-10B-A1.8B · Hugging Face
핵심 요약
GigaChat 3.1 기반의 오디오 네이티브 LLM으로, 음성 이해와 시간적 정밀 분석 기능을 갖춘 모델입니다.
- 오디오 네이티브 LLM — GigaChat 3.1 Lightning을 기반으로 음성 이해 기능을 추가함
- 시간적 정밀 분석 — 긴 오디오 내 이벤트 위치 파악 및 타임스탬프 기반 요약 가능
- 학습 데이터셋 — TimeGround-1M을 통해 시간 정렬 주석 학습
- 다양한 기능 — 오디오 질의응답, 분류, 도구 사용 및 텍스트 작업 지원
huggingface.co
원문 사이트로 이동
GigaChat Audio 10B는 GigaChat 3.1 Lightning 텍스트 모델을 기반으로 구축된 오디오 네이티브 LLM입니다. Conformer 음성 인코더와 모달리티 어댑터가 오디오 임베딩을 Mixture-of-Experts 디코더로 직접 전달하므로, 모델은 기존 텍스트 품질을 유지하면서 음성 이해 능력을 추가했습니다.
기능: 오디오 질의응답 및 분류, 시간적 정밀 분석(긴 오디오 내 위치 파악, 타임스탬프가 포함된 이벤트 설명, 타임스탬프가 포함된 오디오 요약), 도구 사용 및 텍스트 전용 작업.
시간적 정밀 분석 기술은 시간 정렬 주석이 포함된 긴 형식의 오디오로 특별히 구축된 데이터셋인 TimeGround-1M으로 학습되었습니다.


