新论文聚焦 LLM 探索能力的边界
DORA、3PO 和 RISE-RL 提出多种方法,试图改进智能体探索与 RL 训练。
为什么重要
这些论文共同指向了温度缩放等 token 级探索方法的局限:它们未必能带来有用的序列级多样性。更好的探索机制有望改进 LLM 智能体、推理训练和开放式对齐流程,而不只是依赖提示词调整或标量奖励。
核心要点
- 1.DORA 无需训练即可改善序列级探索。
- 2.3PO 通过采样策略让 RLVR rollout 更多样。
- 3.RISE-RL 针对反复遗漏的评分标准进行探索。
多篇 arXiv 论文介绍了提升大型语言模型探索能力的新方法。DORA Explorer 是一种无需训练、在推理时运行的算法:它会生成多个候选动作,用序列级 log-probability 统计对其打分,并通过可调探索参数进行采样。3PO 面向 RLVR,在参数空间中探索,通过从后验分布中采样不同策略来实现;RISE-RL 则利用反复遗漏的评分标准,引导开放式 RL 中的选择性探索。
⚡ 今天就能用
在仅依赖温度参数进行智能体探索或 RL rollout 之前,建议先阅读 DORA 和 3PO 论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AIDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIRISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement LearningAug 11, 12:00 PM↗
- arXiv cs.LGParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- HF Daily PapersParameter Exploration for RLVR via Variational LearningAug 10, 8:28 PM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。