AAI News Hub
研究Thu, August 20, 2026·1d ago

WithEveryone、多人数の画像生成を改善

このフレームワークは、最大10人の参照人物を保つためにアイデンティティトークンとレイアウト計画を用いる。

なぜ重要か

この研究は、指定した複数の人物を1つのシーンに、取り違えや抜け、重複なしで確実に配置するという、画像生成でよく見られる弱点に取り組むものだ。アイデンティティの接地が向上すれば、グループ画像のワークフローはより制御しやすく、評価もしやすくなる可能性がある。

要点

  • 1.最大10人の参照アイデンティティを含むグループ画像に対応。
  • 2.GPT-Image-2と比べ、ベンチマークでの顔類似度が向上。
  • 3.コピー&ペースト由来のアーティファクトと重複したアイデンティティ出力を削減。

研究者らは、最大10人の参照アイデンティティを扱うグループ画像生成フレームワーク「WithEveryone」を発表した。この手法は、各アイデンティティをアドレス付きトークンとして注入し、アイデンティティ・レイアウト計画を予測する。さらに、レイアウトに基づくアイデンティティ損失とID表現の強制により、アイデンティティの結び付けを改善する。アイデンティティが重複しないベンチマークでは、顔類似度がGPT-Image-2の0.462から0.499に向上し、コピー&ペースト由来のアーティファクトは0.169から0.055に減少した。

今日から使える

複数の参照にわたってアイデンティティ保持が必要な多人数画像ワークフローを構築する前に、この論文を読んでおきたい。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究