AAI News Hub
研究Tue, August 18, 2026·2d ago2 sources corroborating

研究者ら、構成的な画像・動画編集に照準

新たな論文群が、生成と編集を統合するモデルに向けた学習データと蒸留手法を提案している。

なぜ重要か

この研究は、単一目的の生成システムから、複雑な多段階編集に対応するモデルとデータセットへと重点が移りつつあることを示している。構成的な学習が進めば、統合型マルチモーダルシステムにおける生成能力と編集能力の衝突を抑えられる可能性がある。

要点

  • 1.DanceOPDは、テキストからの画像生成と編集能力の衝突に取り組む。
  • 2.OpenGPT-4o-Imageは、高度な編集タスク向けに8万組のinstruction-imageペアを追加する。
  • 3.CoinVE-200Kは、複数操作を伴う指示追従型動画編集に焦点を当てている。

研究者らは、テキストからの画像生成と画像・動画編集を組み合わせる生成モデルの改善を狙った複数の取り組みを公開、または説明した。DanceOPDは、flow-matchingモデルを対象に、テキストからの画像生成、局所編集、全体編集、リアリズム・フィールド吸収、classifier-free guidance吸収を統合するオンポリシー生成フィールド蒸留フレームワークを提案している。OpenGPT-4o-Imageは、11領域・51サブタスクにわたる8万組のinstruction-imageデータセットを導入し、CoinVE-200Kは、2〜5個の原子的編集操作を含む1080pのペアで、構成的な指示追従型動画編集を対象としている。

今日から使える

混合タスクで統合型の画像・動画編集モデルを学習する前に、各データセットとDanceOPDの論文を確認したい。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究