엔비디아, 허깅페이스에 Cosmos 3 옴니모달 월드 모델 공개
NVIDIA releases Cosmos 3 Omnimodal world modelson HF
핵심 요약
엔비디아가 텍스트, 이미지, 영상, 오디오 및 행동 명령을 생성하는 옴니모달 월드 모델 'Cosmos 3'를 공개했습니다.
- 모델 구성 — 16B(Nano)와 64B(Super) 두 가지 크기로 출시됨
- 옴니모달 기능 — 텍스트, 이미지, 영상, 오디오 등 다양한 입력을 처리하고 생성함
- 활용 분야 — 물리 AI, 세계 이해, 시뮬레이션 및 로봇 정책 학습 등에 사용됨
https://huggingface.co/nvidia/Cosmos3-Super-Text2Image
Nano: 16B
Super: 64B
Cosmos3는 텍스트, 이미지, 영상, 행동 궤적 입력의 조합으로부터 역동적이고 고품질의 영상, 이미지, 오디오 및 행동 명령을 생성할 수 있는 옴니모달 월드 모델 모음입니다. 이는 세계 이해, 세계 생성, 시뮬레이션, 구현된 정책 학습을 아우르는 광범위한 물리 AI 애플리케이션 및 연구를 위한 기초적인 구성 요소 역할을 합니다.
아직 여기서는 별다른 반응이 없네요.
트위터 논의 링크: https://x.com/victormustar/status/2061354267546427595


