AAI News Hub
ForschungTue, August 18, 2026·2d ago2 sources corroborating

Forscher nehmen kompositionelle Bild- und Videobearbeitung ins Visier

Neue Paper schlagen Trainingsdaten und Destillationsmethoden für einheitliche Generierungs- und Bearbeitungsmodelle vor.

Warum es wichtig ist

Die Arbeiten spiegeln eine Verschiebung von Einzweck-Generierungssystemen hin zu Modellen und Datensätzen wider, die für komplexe, mehrstufige Bearbeitung ausgelegt sind. Besseres kompositionelles Training könnte Konflikte zwischen Generierungs- und Bearbeitungsfähigkeiten in einheitlichen multimodalen Systemen verringern.

Die Kernpunkte

  • 1.DanceOPD zielt auf Konflikte zwischen Text-zu-Bild- und Bearbeitungsfähigkeiten.
  • 2.OpenGPT-4o-Image ergänzt 80.000 Instruktions-Bild-Paare für fortgeschrittene Bearbeitungsaufgaben.
  • 3.CoinVE-200K konzentriert sich auf instruktionengeleitete Videobearbeitung mit mehreren Bearbeitungsschritten.

Forscher haben mehrere Arbeiten veröffentlicht oder beschrieben, die darauf abzielen, generative Modelle zu verbessern, die Text-zu-Bild-Erzeugung mit Bild- und Videobearbeitung verbinden. DanceOPD schlägt ein On-Policy-Framework zur Destillation generativer Felder für Flow-Matching-Modelle vor, um Text-zu-Bild, lokale Bearbeitung, globale Bearbeitung, Realism-Field-Absorption und Absorption von classifier-free guidance zusammenzuführen. OpenGPT-4o-Image führt einen Datensatz mit 80.000 Instruktions-Bild-Paaren aus 11 Bereichen und 51 Teilaufgaben ein, während CoinVE-200K auf kompositionelle, instruktionengeleitete Videobearbeitung mit 1080p-Paaren zielt, die 2 bis 5 atomare Bearbeitungsschritte umfassen.

Heute ausprobieren

Prüfen Sie die Datensätze und das DanceOPD-Paper, bevor Sie einheitliche Bild- oder Videobearbeitungsmodelle auf gemischten Aufgaben trainieren.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung