Minimax-H3 비디오 모델 출시, 며칠 내로 오픈 웨이트 공개 예정
Minimax-H3 video model released, open weights coming in the next few days
핵심 요약
텍스트, 이미지, 비디오, 오디오를 통합 처리하는 멀티모달 모델 Minimax-H3가 공개되었으며 곧 오픈 웨이트로 전환될 예정입니다.
- 모델 성능 — 2K 해상도와 스테레오 사운드를 지원하며 기존 모델 대비 3분의 1 수준의 비용 효율성을 제공함
- 멀티모달 기능 — 텍스트, 이미지, 비디오, 오디오를 통합 이해하고 15초 분량의 비디오 생성 및 편집이 가능함
- 오픈 소스 지원 — AI 생태계 활성화를 위해 며칠 내로 모델 웨이트를 공개할 계획임
- 상업적 활용 — 광고, 게임, 이커머스 등 다양한 산업 분야에서 활용 가능한 수준의 성능을 갖춤
https://x.com/MiniMax_AI/status/2083006198828417501?s=20
그들의 기사에서 발췌:
오늘 우리는 범용 멀티모달 생성 모델인 MiniMax H3를 출시합니다. H3는 텍스트, 이미지, 비디오, 오디오 전반에 걸친 통합된 맥락을 이해하며, 2K 해상도에서 최대 15초 분량의 비디오를 네이티브 스테레오 사운드와 함께 생성합니다.
초기 테스트 결과, H3는 지시 이행, 정확한 텍스트 및 브랜드 렌더링, V2V 모션 전송 등 광범위한 사용 사례에서 상업용 콘텐츠 제작에 즉시 투입 가능한 수준임을 보여주었습니다. 정밀하고 제어 가능한 멀티모달 생성 및 편집 기능을 갖춘 H3는 광고, 브랜딩, 이커머스, 제품 디자인, UI/UX, 게임 등을 위해 구축되었습니다.
Contextual Omni Representation, H3-VAE, H3-Omni Transformer, In-Context Regeneration 등의 기술을 기반으로 하는 H3는 업계 최고의 가격 대비 성능을 제공합니다. 기본적으로 2K 해상도를 제공하며, 2K 기준 H3의 초당 가격은 주류 모델들의 3분의 1 미만이고, 768p 기준으로는 주류 모델들의 720p 가격의 절반 미만입니다.
클로즈드 소스 모델들은 오랫동안 비디오 생성 분야를 지배해 왔으며, 대규모 언어 모델과 같은 분야보다 반복 속도가 느리고 생태계가 덜 개방적이었습니다. 오픈 소스 커뮤니티를 지원하고, 더 광범위한 AI 하드웨어와의 호환성을 가속화하며, 사용자들이 자신만의 맞춤형 버전을 더 쉽게 구축할 수 있도록 하기 위해, 우리는 관련 법률 및 규정을 준수하는 범위 내에서 며칠 내로 모델 웨이트를 공개할 계획입니다. 하드웨어 호환성은 H3 설계 초기 단계부터 핵심 고려 사항이었습니다.


