ReflectRL 利用专家失败推理路径训练 LLM
该框架在 on-policy 训练中,将有缺陷的专家轨迹作为反思信号。
为什么重要
这项工作表明,专家失败输出对推理模型而言仍可能是有价值的监督信号,而不只是应该丢弃的样本。如果得到验证,这可能让后训练在难题上更具数据效率,尤其是在更强模型也无法稳定产出正确示范的场景中。
核心要点
- 1.ReflectRL 从专家失败轨迹中学习。
- 2.该方法面向 on-policy 推理后训练。
- 3.实验覆盖 9 个基准和 4 种 LLM 骨干模型。
Hugging Face 上的一篇论文提出了 ReflectRL,这是一种轻量级、即插即用的框架,用于在 on-policy 训练期间提升大语言模型的推理能力。该方法把专家模型在更难问题上失败的轨迹视为“黄金负轨迹”(Golden Negative Trajectories),先用它们引出反思式推理,再将这种行为迁移回直接推理。作者报告称,实验覆盖了 9 个基准、4 种 LLM 骨干模型和 4 种 on-policy 训练设置。
⚡ 今天就能用
在推理模型后训练流程中丢弃专家失败轨迹之前,先读读这篇论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AIReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGPrefix-Guided On-Policy Distillation: Mining Golden Trajectories from RolloutsAug 4, 12:00 PM↗
- HF Daily PapersReflectRL: Learning from Golden Negative Trajectories via Reflective-to-Direct ReasoningAug 4, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。