研究人员瞄准组合式图像与视频编辑
新论文提出面向统一生成与编辑模型的训练数据和蒸馏方法。
为什么重要
这些工作反映出一个趋势:生成系统正从单一用途走向为复杂、多步骤编辑而构建的模型与数据集。更好的组合式训练可能减少统一多模态系统中生成能力与编辑能力之间的冲突。
核心要点
- 1.DanceOPD 瞄准文本生成图像与编辑能力之间的冲突。
- 2.OpenGPT-4o-Image 为高级编辑任务新增 8 万组指令-图像配对数据。
- 3.CoinVE-200K 聚焦于多操作的指令引导视频编辑。
研究人员发布或介绍了多项旨在提升生成式模型能力的工作,这类模型将文本生成图像与图像、视频编辑结合起来。DanceOPD 提出一种面向流匹配模型的在策略生成场蒸馏框架,用于组合文本生成图像、局部编辑、全局编辑、真实感场吸收以及无分类器引导吸收。OpenGPT-4o-Image 推出一个覆盖 11 个领域、51 个子任务的 8 万组指令-图像数据集,而 CoinVE-200K 则面向组合式指令引导视频编辑,提供涉及 2 到 5 个原子编辑操作的 1080p 配对数据。
⚡ 今天就能用
在用混合任务训练统一图像或视频编辑模型之前,应先评估这些数据集和 DanceOPD 论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.CLDanceOPD: On-Policy Generative Field DistillationAug 18, 12:00 PM↗
- arXiv cs.AIOpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and EditingAug 18, 12:00 PM↗
- arXiv cs.LGDanceOPD: On-Policy Generative Field DistillationAug 18, 12:00 PM↗
- HF Daily PapersCoinVE-200K: A Large-Scale High-Quality Dataset for Compositional Instruction-Guided Video EditingAug 18, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。