VA-Judger 瞄准视频-音频生成的奖励建模
研究人员推出用于联合视频-音频奖励建模的人类偏好数据集和基准。
为什么重要
奖励建模正成为多模态生成系统后训练的关键瓶颈。这项工作认为,优化彼此分离的感知指标可能助长奖励黑客行为,并导致模型与人类判断错位。
核心要点
- 1.VA-Judger 对联合视频-音频生成中的人类偏好进行建模。
- 2.VAPref-10K 包含 9K 条提示词和 10.3K 组配对比较。
- 3.这篇论文聚焦于由分离感知指标引发的奖励黑客问题。
一篇新论文介绍了 VA-Judger,这是一个基于人类偏好反馈训练、面向联合视频-音频生成的奖励模型。作者表示,现有奖励方法通常把音频质量、视觉保真度和同步性等独立指标组合起来,这可能忽略文本提示、视频和音频之间的语义与时间连贯性。他们还构建了 VAPref-10K,包含 9K 条提示词和 10.3K 组细粒度成对比较,并推出 VA-Judger-Bench,用于域内和域外评测。
⚡ 今天就能用
在将独立的音频、视频和同步指标用作视频-音频生成奖励之前,先审视 VA-Judger-Bench。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。