Abra 研究描绘扩散图像训练的缩放规律
HF Daily Papers 重点介绍了一项针对文本生成图像扩散模型的计算缩放研究。
为什么重要
这项工作为视觉生成提供了实用的缩放指导;相比语言建模,视觉生成领域的计算最优训练规则仍不够成熟。研究结果表明,在为扩散图像系统分配计算资源时,数据量可能比模型规模更重要。
核心要点
- 1.Abra 研究了 10^19 到 10^22 FLOPs 范围内的扩散模型缩放规律。
- 2.计算最优点出现在约每个参数对应 200 个图像 token。
- 3.扩散模型似乎对过度训练具有鲁棒性。
研究人员提出了 Abra,这是一组受控的 flow-matching Transformer 模型,用于研究文本生成图像扩散模型在 10^19 到 10^22 FLOPs 计算预算下的缩放表现。研究报告称,扩散模型像语言模型一样具备可预测的缩放规律,但其计算最优点约为每个参数对应 200 个图像 token,大约是 LLM 的 Chinchilla 法则所建议比例的十倍。研究还发现,扩散模型对过度训练具有较强鲁棒性,而且这种可预测性不只体现在训练损失上,也延伸到质量指标、CFG 设置、表征质量和训练曲线形态。
⚡ 今天就能用
训练扩散图像模型时,应先优先增加训练数据,再扩大模型规模。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。