AAI News Hub
InvestigaciónTue, August 18, 2026·2d ago2 sources corroborating

Investigadores apuntan a la edición composicional de imágenes y video

Nuevos artículos proponen datos de entrenamiento y métodos de destilación para modelos unificados de generación y edición.

Por qué importa

El trabajo refleja un giro desde sistemas de generación de propósito único hacia modelos y conjuntos de datos diseñados para edición compleja y de varios pasos. Un mejor entrenamiento composicional podría reducir los conflictos entre las capacidades de generación y edición en sistemas multimodales unificados.

Puntos clave

  • 1.DanceOPD aborda los conflictos entre las capacidades de texto a imagen y de edición.
  • 2.OpenGPT-4o-Image suma 80.000 pares instrucción-imagen para tareas avanzadas de edición.
  • 3.CoinVE-200K se centra en la edición de video guiada por instrucciones con múltiples operaciones.

Investigadores publicaron o describieron varios esfuerzos orientados a mejorar modelos generativos que combinan la generación de texto a imagen con la edición de imágenes y video. DanceOPD propone un marco de destilación de campos generativos on-policy para modelos de flow matching, con el fin de componer generación de texto a imagen, edición local, edición global, absorción de campos de realismo y absorción de guía sin clasificador. OpenGPT-4o-Image presenta un conjunto de datos de 80.000 pares instrucción-imagen en 11 dominios y 51 subtareas, mientras que CoinVE-200K se centra en la edición composicional de video guiada por instrucciones, con pares en 1080p que implican entre 2 y 5 operaciones de edición atómicas.

Pruébalo hoy

Revise los conjuntos de datos y el artículo de DanceOPD antes de entrenar modelos unificados de edición de imágenes o video con tareas mixtas.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación