inclusionAI/Realtime-Venus · 허깅페이스
inclusionAI/Realtime-Venus · Hugging Face
핵심 요약
실시간 시청각 상호작용과 능동적 응답 기능을 갖춘 9B 파라미터 모델 Realtime-Venus가 공개되었습니다.
- 실시간 상호작용 — 시청각 데이터를 지속적으로 처리하며 능동적인 대화와 중단 처리가 가능함
- 학습 없는 메모리 — 별도의 추가 학습 없이 긴 영상의 시각적 정보를 기억하고 검색함
- 전이중 대화 — 말하는 도중에도 주변 상황을 인식하고 끼어들기나 교정을 구분함
- 하드웨어 활용 — 홈 어시스턴트나 스마트폰 등 다양한 실시간 AI 비서 환경에 적용 가능함
huggingface.co
원문 사이트로 이동
옴니 좀 필요해? 여기 옴니 가져왔어.
https://huggingface.co/inclusionAI/Realtime-Venus#1-🧭-overview1\. 🧭 개요
이 저장소는 Realtime-Venus 시스템의 체크포인트 두 개를 담고 있어:
-
Realtime-Venus-Omni (
Realtime-Venus-Omni/): 9B 오디오-비주얼 인터랙션 모델이야. 계속 보고 듣다가, 언제 어떻게 반응할지 스스로 결정해서 텍스트랑 음성을 하나의 타임라인에서 동시에 뽑아내지. MiniCPM-o 4.5를 기반으로 만들었고, 선제적 상호작용, 의미론적 끼어들기 처리, 학습 없이도 가능한 긴 영상 메모리 기능을 지원해. -
Realtime-Venus-Audio (
Realtime-Venus-Audio/): 같은 스트리밍 백본을 쓰는 오디오 특화 체크포인트야. 오디오 이해랑 텍스트/음성 출력을 통한 오디오 기반 대화에 최적화돼 있어.
두 디렉토리 모두 모델 가중치랑 커스텀 Hugging Face Transformers 코드가 들어있어. 비동기식 Realtime-Venus-Harness랑 외부 툴 연동 관련 내용은 GitHub 저장소에서 확인해.
https://huggingface.co/inclusionAI/Realtime-Venus#2-✨-highlights2\. ✨ 주요 특징
-
네이티브 풀 듀플렉스 대화: 말하는 중에도 계속 상황을 파악하고, 맞장구, 끼어들기, 수정, 화제 전환 같은 걸 다 구분해낼 수 있어.
-
옴니 선제적 상호작용: 시간 순서대로 정렬된 영상이랑 오디오를 계속 처리하다가, 이벤트가 발생하면 사용자가 시키지 않아도 알아서 먼저 반응을 시작해.
-
위임(Delegation): 공유된 타임라인 위에서
<delegate>요청을 스트림에 바로 띄우고 비동기식 백엔드 결과를 똑같은 방식으로 받아와. 그래서 외부 작업을 처리하느라 대화가 끊길 일이 없지. (요청을 실행하려면 GitHub 저장소에 있는 Realtime-Venus-Harness 런타임이 필요해.) -
학습이 필요 없는 긴 영상 메모리: 영상에서 중요한 순간들을 알아서 저장하고, 질문이랑 관련 있는 핵심 정보만 딱 골라내서 오디오-비주얼 맥락을 다시 구성해. 추가 학습 같은 건 전혀 필요 없어.
-
텍스트 및 음성 출력: 포함된 Token2wav 리소스랑 참조 음성을 사용해서, 반응 텍스트랑 네이티브 음성을 동시에 생성해.

