AAI News Hub
PesquisaTue, August 18, 2026·2d ago2 sources corroborating

Pesquisadores miram edição composicional de imagens e vídeos

Novos papers propõem dados de treinamento e métodos de destilação para modelos unificados de geração e edição.

Por que importa

O trabalho reflete uma mudança de sistemas de geração com finalidade única para modelos e conjuntos de dados criados para edição complexa em múltiplas etapas. Um treinamento composicional melhor pode reduzir conflitos entre capacidades de geração e edição em sistemas multimodais unificados.

Pontos-chave

  • 1.O DanceOPD mira conflitos entre capacidades de texto para imagem e de edição.
  • 2.O OpenGPT-4o-Image adiciona 80.000 pares instrução-imagem para tarefas avançadas de edição.
  • 3.O CoinVE-200K se concentra em edição de vídeo guiada por instruções com múltiplas operações.

Pesquisadores divulgaram ou descreveram várias iniciativas voltadas a melhorar modelos generativos que combinam geração de texto para imagem com edição de imagens e vídeos. O DanceOPD propõe um framework de destilação de campo generativo on-policy para modelos de flow matching, capaz de compor texto para imagem, edição local, edição global, absorção de campo de realismo e absorção de classifier-free guidance. O OpenGPT-4o-Image apresenta um conjunto de dados com 80.000 pares instrução-imagem em 11 domínios e 51 subtarefas, enquanto o CoinVE-200K mira a edição composicional de vídeo guiada por instruções, com pares em 1080p envolvendo de 2 a 5 operações atômicas de edição.

Experimente hoje

Revise os conjuntos de dados e o paper do DanceOPD antes de treinar modelos unificados de edição de imagens ou vídeos em tarefas mistas.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa