AAI News Hub
研究Wed, August 5, 2026·Aug 5

研究人员推进用于机器人操作的 VLA 模型

两篇论文聚焦更细粒度、更具泛化能力的视觉-语言-动作机器人控制。

为什么重要

这两篇论文都指向机器人基础模型的一个核心局限:如何把视觉-语言理解转化为在局部接触动态和不断变化的 3D 场景中可靠执行的动作。相关工作表明,VLA 系统正走向利用任务条件下的未来预测和记忆,而不是把每次观测都当作静态上下文来处理。

核心要点

  • 1.W2-VLA 预测未来腕部潜变量,用于细粒度操作。
  • 2.BridgeVLA++ 为 3D VLA 框架加入时空记忆。
  • 3.两者都聚焦数据效率、泛化能力和更丰富的动作上下文。

两篇 HF Daily Papers 条目介绍了面向机器人操作的新型视觉-语言-动作方法。World-to-Wrist VLA 会在任务上下文条件下建模未来的腕部视角潜变量,以提升细粒度操作能力,并引入辅助性的 W2-CoT 标注,覆盖操作进展、转换线索和腕部局部证据。BridgeVLA++ 在 BridgeVLA 基础上加入面向 3D 操作的时空记忆,旨在提升数据效率、分布偏移下的泛化能力,以及对观测历史的推理能力。

今天就能用

在为需要腕部摄像头推理或观测历史记忆的操作任务选择 VLA 架构之前,建议先阅读这两篇论文。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究