텐센트의 Hy-Embodied-RxBrain-1.0 · 허깅페이스
tencent/Hy-Embodied-RxBrain-1.0 · Hugging Face
핵심 요약
언어 추론과 시각적 상상을 결합해 물리적 세계의 미래 상태를 예측하는 멀티모달 파운데이션 모델입니다.
- 멀티모달 모델 — 언어 추론과 시각적 상상을 결합해 물리적 세계의 미래 상태를 예측함
- 통합 아키텍처 — 텍스트와 비전, 생성 모델을 하나의 오토리그레시브 모델로 통합함
- 플로우 매칭 헤드 — FLUX VAE 잠재 공간을 활용해 미래 프레임을 생성하고 계획을 수립함
huggingface.co
원문 사이트로 이동
소개
RxBrain (Hy-Embodied-RxBrain-1.0)은 체화된 인지를 위한 통합 멀티모달 파운데이션 모델입니다. 언어 추론과 시각적 상상을 결합하여 세 가지 핵심 기능을 제공하는 단일 모델입니다.
- 🤖 체화된 이해 및 추론 — 이미지와 다중 프레임 비디오에 대한 질의응답 및 사고의 연쇄(chain-of-thought) 수행.
- 🔮 세계 상태 예측 — 물리적 세계에서 특정 행동이 만들어낼 가까운 미래의 프레임을 상상함.
- 🧩 공동 하위 목표 계획 — 작업을 단계별로 분해하여, 각 단계마다 다음 행동(언어)과 도달해야 할 목표 이미지(비전)를 모두 출력함.
이러한 기능들은 **인터리브 생성(interleaved generation)**을 통해 통합됩니다. 단일 오토리그레시브 시퀀스 내에서 RxBrain은 추론 텍스트와 플로우 매칭으로 생성된 프레임을 번갈아 출력합니다. 학습된 <Image> 토큰이 상상할 시점을 결정하며, 이를 통해 체화된 계획은 무엇을 할지와 세상이 어떻게 보여야 할지를 단계별로 결합합니다.
⭐️ 주요 기능
- 🧠 통합 Mixture-of-Transformers (MoT): 모달리티별 경로(텍스트/비전/생성)를 갖춘 약 62억 파라미터의 백본으로, 이해와 이미지 합성이 별도의 타워가 아닌 하나의 오토리그레시브 모델을 공유함.
- 🎨 플로우 매칭 이미지 헤드: 상상된 프레임은 고정된 FLUX VAE 잠재 공간으로 디코딩하는 플로우 매칭 헤드에 의해 생성되며, 텍스트-투-이미지, 다중 프레임 세계 모델 롤아웃, 목표 이미지 계획을 가능하게 함.
- 🔗 인터리브 추론 + 상상: 텍스트 추론과 생성된 프레임이 하나의 시퀀스로 출력되어, 상징적 계획과 시각적 목표를 결합함.


