HelloWorld、動画ワールドモデルに社会的インタラクションを追加
この研究モデルでは、画面上のキャラクターが手を振る、あいさつするなどのユーザープロンプトに応答できる。
なぜ重要か
この研究は、動画ワールドモデルにおける課題、つまり事前に書かれた動きやシーンのプロンプトに従うだけでなく、ユーザーに社会的に応答できるキャラクターの実現を狙っている。また、こうしたシステムにおける社会的インタラクションの挙動を測定するベンチマーク「HelloWorldBench」も導入している。
要点
- 1.HelloWorldは、動画世界内でボタン操作をきっかけにしたキャラクター応答を可能にする。
- 2.自己蒸留により、インタラクションとカメラモーションを含む合成クリップで学習する。
- 3.学習不要のモジュールが、ボタン押下中の時間範囲に応答を局所化する。
研究者らは、生成された動画世界の中でユーザーとキャラクターの社会的インタラクションを支援する動画ワールドモデル「HelloWorld」を発表した。ユーザーはボタンを押すことで、キャラクターにカメラの方向へ向き直る、手を振る、うなずく、短いあいさつを話すといった反応を促せる。このシステムは、合成クリップを用いた自己蒸留と、クロスアテンションマスクによってボタン押下中の時間範囲にインタラクションを局所化する学習不要の推論モジュールを使用している。
⚡ 今日から使える
動画ワールドモデル向けのインタラクティブなキャラクター操作を設計する前に、論文とベンチマークを確認したい。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。