AAI News Hub
研究Tue, August 4, 2026·Aug 42 家媒体交叉佐证

研究人员指出驾驶 VLM 训练中的轨迹偏差

论文提出 AD-MCQ 和 DEFT-RLVR,让自动驾驶推理更可验证。

为什么重要

这项工作凸显了自动驾驶 VLM 数据生成中的一种失效模式:推理轨迹看似合理,却可能在因果上并不忠实。它还指出,多项选择式、可验证的轨迹选择,可以作为评估和训练规划决策的一种方式,而无需进行开放式轨迹合成。

核心要点

  • 1.真实未来轨迹可能锚定教师模型的推理。
  • 2.AD-MCQ 将驾驶规划转化为候选轨迹选择。
  • 3.DEFT-RLVR 在可验证推理中延后暴露未来轨迹。

一篇新的 arXiv 论文认为,一些自动驾驶 VLA 标注流程会让教师模型接触到日志中记录的真实未来轨迹,从而产生轨迹锚定偏差。作者称,这可能让教师模型为已知结果寻找理由,而不是基于场景证据推断决策,进而生成因果忠实度较低的思维链推理,并在复杂场景中产生更严重的幻觉。论文引入 AD-MCQ,将规划表述为在明确的候选轨迹中进行选择,并提出 DEFT-RLVR,用于在可验证推理训练中延后暴露未来轨迹。

今天就能用

在使用自动驾驶 CoT 数据流程训练或评估 VLM 规划器之前,应审计其中是否存在真实未来轨迹泄漏。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究