研究人员瞄准 VLA 机器人模型的更优训练方式
两篇论文提出新框架,旨在提升机器人操作模型的数据效率、泛化能力和记忆能力。
为什么重要
这项工作反映出业界正推动 VLA 模型训练变得更可比较、更具数据效率,并在分布偏移下更加稳健。更好地处理语言监督、未来状态对齐和记忆机制,可能会影响机器人团队设计操作系统的方式。
核心要点
- 1.VLAFlow 在同一架构下比较四种 VLA 预训练范式。
- 2.BridgeVLA++ 为 3D 操作加入时空记忆。
- 3.两篇论文都聚焦于机器人 VLA 的泛化能力和数据效率。
研究人员介绍了两个面向机器人操作的视觉-语言-动作框架:VLAFlow 和 BridgeVLA++。VLAFlow 提供统一的流匹配设置,在共享架构上比较机器人数据预训练目标,并使用来自 OXEMix 的约 5,000 小时异构机器人数据。BridgeVLA++ 则在 BridgeVLA 基础上加入时空记忆,使 3D 操作模型能够利用持久的空间上下文和观测历史。
⚡ 今天就能用
在为机器人操作模型选择预训练目标或记忆设计之前,应先查阅 VLAFlow 和 BridgeVLA++ 论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。