研究人员提出 DASH,以减少推理模型的“过度思考”
这种片段级信用分配方法利用中间答案承诺来引导推理模型训练。
为什么重要
这项工作瞄准了推理模型中的一个现实低效问题:更长的推理轨迹可能增加成本,却未必提升准确率。片段级信用分配或许能帮助训练方法奖励有用的反思,同时抑制低效的推理循环。
核心要点
- 1.DASH 在推理片段层面分配信用。
- 2.该方法使用中间答案承诺作为代理信号。
- 3.它在竞赛级数学基准上报告了 59.45% 的平均准确率。
一篇 arXiv 论文介绍了 DASH,即 Drift Aware advantage SHaping,一种面向推理语言模型的片段级信用分配方法。作者表示,推理模型常会通过含糊试探、放弃既有路径和自相矛盾而陷入“过度思考”,消耗 token 却无法提升答案质量。DASH 将中间答案承诺作为低成本代理信号,用来判断后续反思是在接近还是偏离正确性;在过度思考较为普遍的竞赛级数学基准上,DASH 报告的平均准确率为 59.45%,高于 Dr.GRPO 的 58.1% 和 GRPO 的 56.95%。
⚡ 今天就能用
在调优奖励长思维链的推理模型 RL 目标之前,先读读这篇论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。