研究人员指出驾驶 VLM 训练中的轨迹偏差
论文提出 AD-MCQ 和 DEFT-RLVR,让自动驾驶推理更可验证。
为什么重要
这项工作凸显了自动驾驶 VLM 数据生成中的一种失效模式:推理轨迹看似合理,却可能在因果上并不忠实。它还指出,多项选择式、可验证的轨迹选择,可以作为评估和训练规划决策的一种方式,而无需进行开放式轨迹合成。
核心要点
- 1.真实未来轨迹可能锚定教师模型的推理。
- 2.AD-MCQ 将驾驶规划转化为候选轨迹选择。
- 3.DEFT-RLVR 在可验证推理中延后暴露未来轨迹。
一篇新的 arXiv 论文认为,一些自动驾驶 VLA 标注流程会让教师模型接触到日志中记录的真实未来轨迹,从而产生轨迹锚定偏差。作者称,这可能让教师模型为已知结果寻找理由,而不是基于场景证据推断决策,进而生成因果忠实度较低的思维链推理,并在复杂场景中产生更严重的幻觉。论文引入 AD-MCQ,将规划表述为在明确的候选轨迹中进行选择,并提出 DEFT-RLVR,用于在可验证推理训练中延后暴露未来轨迹。
⚡ 今天就能用
在使用自动驾驶 CoT 数据流程训练或评估 VLM 规划器之前,应审计其中是否存在真实未来轨迹泄漏。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AIDeferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMsAug 4, 12:00 PM↗
- arXiv cs.AIDeferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMsAug 4, 12:00 PM↗
- HF Daily PapersDeferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMsAug 3, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。