Abra研究、拡散画像モデルの学習におけるスケーリング則を分析
HF Daily Papersが、テキスト画像生成の拡散モデルを対象にした計算量スケーリング研究を取り上げた。
なぜ重要か
この研究は、言語モデリングに比べて計算最適な学習則が十分に確立されていない画像生成分野に、実用的なスケーリング指針を提供する。結果は、拡散画像システムに計算資源を配分する際、モデルサイズよりもデータ量の方が重要になり得ることを示唆している。
要点
- 1.Abraは10^19から10^22 FLOPsの範囲で拡散モデルのスケーリングを調べている。
- 2.計算最適性は、パラメータ1つあたり約200個の画像トークン付近で達成される。
- 3.拡散モデルは過学習に強い可能性がある。
研究者らは、テキスト画像生成の拡散モデルが計算量に応じてどうスケールするかを調べるため、flow-matching transformerの制御されたモデル群「Abra」を発表した。対象とした計算予算は10^19から10^22 FLOPsに及ぶ。研究では、拡散モデルも言語モデルと同様に予測可能な形でスケールする一方、計算最適となるのはパラメータ1つあたり約200個の画像トークンで、LLM向けのChinchilla則の約10倍に相当すると報告している。また、拡散モデルは過学習に強く、予測可能性は学習損失にとどまらず、品質指標、CFG設定、表現品質、学習曲線の形状にも及ぶことが示された。
⚡ 今日から使える
拡散画像モデルを学習する際は、モデルサイズを拡大する前に、より多くの学習データを優先すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
スタートアップ、AIによるがん治療の進展にはデータが鍵と指摘
TechCrunchによると、このスタートアップは、より良いデータがなければAIはがん治療の実現に近づいていないと主張している。
HarnessRisk、エージェント・ハーネスの安全性障害をベンチマーク
このベンチマークは、エージェント・ハーネスの各フェーズにおける攻撃を検証する。一方、関連研究ではタスクごとのプロビジョニングが検討されている。
Agent Lightning v1.0、ハーネス型エージェントRLを照準に
このフレームワークは、任意のエージェント・ハーネスを強化学習によるポストトレーニングに接続する。