Des chercheurs ciblent l’édition compositionnelle d’images et de vidéos
De nouveaux articles proposent des données d’entraînement et des méthodes de distillation pour des modèles unifiés de génération et d’édition.
Pourquoi c'est important
Ces travaux reflètent un passage de systèmes de génération à usage unique vers des modèles et jeux de données conçus pour l’édition complexe en plusieurs étapes. Un meilleur entraînement compositionnel pourrait réduire les conflits entre capacités de génération et d’édition dans les systèmes multimodaux unifiés.
Points clés
- 1.DanceOPD cible les conflits entre les capacités de texte-image et d’édition.
- 2.OpenGPT-4o-Image ajoute 80 000 paires instruction-image pour des tâches d’édition avancées.
- 3.CoinVE-200K se concentre sur l’édition vidéo guidée par instructions à opérations multiples.
Des chercheurs ont publié ou décrit plusieurs initiatives visant à améliorer les modèles génératifs qui combinent génération texte-image et édition d’images et de vidéos. DanceOPD propose un cadre de distillation générative on-policy pour les modèles de flow matching, afin de composer génération texte-image, édition locale, édition globale, absorption du champ de réalisme et absorption du guidage sans classifieur. OpenGPT-4o-Image introduit un jeu de données de 80 000 paires instruction-image couvrant 11 domaines et 51 sous-tâches, tandis que CoinVE-200K cible l’édition vidéo compositionnelle guidée par instructions avec des paires en 1080p impliquant de 2 à 5 opérations d’édition atomiques.
⚡ À tester aujourd'hui
Examiner les jeux de données et l’article DanceOPD avant d’entraîner des modèles unifiés d’édition d’images ou de vidéos sur des tâches mixtes.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.CLDanceOPD: On-Policy Generative Field DistillationAug 18, 12:00 PM↗
- arXiv cs.AIOpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and EditingAug 18, 12:00 PM↗
- arXiv cs.LGDanceOPD: On-Policy Generative Field DistillationAug 18, 12:00 PM↗
- HF Daily PapersCoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video EditingAug 18, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une startup affirme que les données sont essentielles aux avancées de l’IA contre le cancer
Selon TechCrunch, la startup estime que l’IA est encore loin de guérir le cancer sans de meilleures données.
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.