WithEveryone 改进多人图像生成
该框架通过身份 token 和布局规划,在最多十个参考人物中保持身份一致。
为什么重要
这项工作瞄准了图像生成中的一个常见短板:如何在同一场景中可靠地放置多个指定人物,避免身份错位、遗漏或重复。更好的身份 grounding 可能让群像生成流程更可控,也更容易评估。
核心要点
- 1.支持最多十个参考身份的群像生成。
- 2.相比 GPT-Image-2,基准测试中的人脸相似度有所提升。
- 3.减少了复制粘贴伪影和重复身份输出。
研究人员推出了 WithEveryone,这是一个面向群像生成的框架,最多可支持十个参考身份。该方法将每个身份作为可寻址 token 注入,预测身份布局方案,并结合基于布局的身份损失和 ID 表征强制机制来提升身份绑定效果。在一个身份不重叠的基准测试中,它将人脸相似度从 GPT-Image-2 的 0.462 提升至 0.499,并将复制粘贴伪影从 0.169 降至 0.055。
⚡ 今天就能用
在构建需要跨多个参考图保持身份一致的多人图像工作流之前,建议先阅读这篇论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。