研究人员瞄准机器人策略的更快适应能力
新的 VLA 与控制策略方法,旨在降低机器人操作中的数据、算力和再训练需求。
为什么重要
这些工作反映了机器人领域的一个共同瓶颈:预训练策略具备泛化能力,但在处理新任务和执行误差时,往往仍需要成本高昂的数据采集、微调或再训练。更高效的适应机制,可能让基于 VLA 的操作系统在受控演示之外更具实用性。
核心要点
- 1.EXIMO 使用 VLM 规划器引导 VLA 探索。
- 2.EXPO-FT 聚焦于面向预训练 VLA 的样本高效强化学习微调。
- 3.ORPA 在不修改基础策略参数的情况下,于运行时调整动作。
多篇最新研究论文提出了让机器人操作策略在预训练或模仿学习后更高效适应的方法。EXIMO 使用视觉语言模型作为规划器,帮助视觉语言动作策略在模仿与优化前收集任务数据;EXPO-FT 提出面向预训练 VLA 策略的样本高效强化学习微调方法;LoopVLA 学习判断何时仅通过循环式表征细化就足以完成动作预测;ORPA 则加入一个以反馈为条件的残差模块,在不改变基础策略参数的情况下进行运行时修正。
⚡ 今天就能用
在选择机器人适应策略前,应先阅读相关论文:它们面向的约束各不相同,包括新任务学习、强化学习微调、推理效率和运行时修正。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- HF Daily PapersEXIMO: VLM Guided Exploration of VLA PoliciesAug 20, 4:00 AM↗
- arXiv cs.AIEXPO-FT: Sample-Efficient Reinforcement Learning Finetuning for Vision-Language-Action ModelsAug 19, 12:00 PM↗
- arXiv cs.AILoopVLA: Learning Sufficiency in Recurrent Refinement for Vision-Language-Action ModelsAug 19, 12:00 PM↗
- arXiv cs.AIORPA: Online Residual Policy Adaptation for Robot Manipulation Control with Human FeedbackAug 19, 12:00 PM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。