H3-World: 언어 이해를 세계 제어로 전환하기
H3-World: Turning Language Understanding into World Control
핵심 요약
비디오 생성 모델에서 텍스트 명령을 통해 캐릭터와 카메라 움직임을 정밀하게 제어하는 연구인 H3-World 소개.
- 언어 기반 제어 — 텍스트 명령을 통해 캐릭터와 카메라 동작을 모델에 주입함.
- 시간적 정밀도 — 비디오 잠재 구간별로 동작 프롬프트를 할당하여 정교한 제어 구현.
- 효율적 학습 — 적은 데이터와 LoRA 단계만으로도 새로운 시각적 시나리오를 생성함.
- 오픈 소스 연구 — 모델, 코드, 논문을 공개하여 누구나 활용 가능하게 함.
-
Language-Native Control: 캐릭터랑 카메라 동작을 텍스트 지시어로 조합해서 MiniMax-H3의 사전 학습된 텍스트 경로로 때려 박는 방식임.
-
Temporally Grounded: 비디오 레이턴트 구간마다 동작 프롬프트를 하나씩 할당해서, 시간이 지나면서 동작이 바뀔 때도 칼같이 제어 가능함.
-
Efficient & Generalizable: 게임 플레이 샘플 딱 8,000개, LoRA 스텝 10,000번, 학습 파라미터 0.199%만 써서 캐릭터랑 카메라 움직임을 제어함. 처음 보는 동작 조합이나 비주얼 시나리오도 다 커버 가능함.
✏️ Paper: https://huggingface.co/papers/2609.01560
📄 ArXiv: https://arxiv.org/abs/2609.01560
💻 Code: https://github.com/Danzer1xxxxChan/H3-World
🏠 Project: https://danzer1xxxxchan.github.io/H3-World/
🤗 Model: https://huggingface.co/DANNY621/H3-World


