AAI News Hub
RechercheTue, August 18, 2026·2d ago2 sources corroborating

Des chercheurs ciblent l’édition compositionnelle d’images et de vidéos

De nouveaux articles proposent des données d’entraînement et des méthodes de distillation pour des modèles unifiés de génération et d’édition.

Pourquoi c'est important

Ces travaux reflètent un passage de systèmes de génération à usage unique vers des modèles et jeux de données conçus pour l’édition complexe en plusieurs étapes. Un meilleur entraînement compositionnel pourrait réduire les conflits entre capacités de génération et d’édition dans les systèmes multimodaux unifiés.

Points clés

  • 1.DanceOPD cible les conflits entre les capacités de texte-image et d’édition.
  • 2.OpenGPT-4o-Image ajoute 80 000 paires instruction-image pour des tâches d’édition avancées.
  • 3.CoinVE-200K se concentre sur l’édition vidéo guidée par instructions à opérations multiples.

Des chercheurs ont publié ou décrit plusieurs initiatives visant à améliorer les modèles génératifs qui combinent génération texte-image et édition d’images et de vidéos. DanceOPD propose un cadre de distillation générative on-policy pour les modèles de flow matching, afin de composer génération texte-image, édition locale, édition globale, absorption du champ de réalisme et absorption du guidage sans classifieur. OpenGPT-4o-Image introduit un jeu de données de 80 000 paires instruction-image couvrant 11 domaines et 51 sous-tâches, tandis que CoinVE-200K cible l’édition vidéo compositionnelle guidée par instructions avec des paires en 1080p impliquant de 2 à 5 opérations d’édition atomiques.

À tester aujourd'hui

Examiner les jeux de données et l’article DanceOPD avant d’entraîner des modèles unifiés d’édition d’images ou de vidéos sur des tâches mixtes.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche