AnyTalk 无需动画数据即可生成语音动画
该方法通过改造视频扩散模型,生成口型同步的 3D 角色语音动画。
为什么重要
这项工作为角色语音动画提供了一条低数据需求路径,减少了对特定角色训练集、绑定或重新拓扑的依赖。如果在生产环境中得到验证,基于扩散模型的运动先验可能让口型同步的 3D avatar 更容易部署到不同网格和 blendshape 系统中。
核心要点
- 1.为任意角色生成口型同步的 3D 语音动画。
- 2.在没有动画数据的情况下进行角色微调。
- 3.蒸馏版 AnyTalk_RT 目标是实现实时性能。
研究人员提出了 AnyTalk,一种无需动画数据即可为任意角色生成 3D 语音动画的方法。该方法先将预训练视频扩散模型在目标 3D 角色的渲染图像上进行微调,并配对置零的音频嵌入;随后估计 blendshape 参数,把生成的说话头像视频转换为 3D 语音动画。作者还介绍了 AnyTalk_RT,这是一个面向实时性能的蒸馏版本。
⚡ 今天就能用
在构建需要动画数据或重度绑定的特定角色口型同步流水线之前,先读这篇论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。