AAI News Hub
研究Thu, August 20, 2026·1d ago

WithEveryone 改进多人图像生成

该框架通过身份 token 和布局规划,在最多十个参考人物中保持身份一致。

为什么重要

这项工作瞄准了图像生成中的一个常见短板:如何在同一场景中可靠地放置多个指定人物,避免身份错位、遗漏或重复。更好的身份 grounding 可能让群像生成流程更可控,也更容易评估。

核心要点

  • 1.支持最多十个参考身份的群像生成。
  • 2.相比 GPT-Image-2,基准测试中的人脸相似度有所提升。
  • 3.减少了复制粘贴伪影和重复身份输出。

研究人员推出了 WithEveryone,这是一个面向群像生成的框架,最多可支持十个参考身份。该方法将每个身份作为可寻址 token 注入,预测身份布局方案,并结合基于布局的身份损失和 ID 表征强制机制来提升身份绑定效果。在一个身份不重叠的基准测试中,它将人脸相似度从 GPT-Image-2 的 0.462 提升至 0.499,并将复制粘贴伪影从 0.169 降至 0.055。

今天就能用

在构建需要跨多个参考图保持身份一致的多人图像工作流之前,建议先阅读这篇论文。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究