AAI News Hub
研究Thu, August 13, 2026·5d ago2 家媒体交叉佐证

新论文聚焦 LLM 探索能力的边界

DORA、3PO 和 RISE-RL 提出多种方法,试图改进智能体探索与 RL 训练。

为什么重要

这些论文共同指向了温度缩放等 token 级探索方法的局限:它们未必能带来有用的序列级多样性。更好的探索机制有望改进 LLM 智能体、推理训练和开放式对齐流程,而不只是依赖提示词调整或标量奖励。

核心要点

  • 1.DORA 无需训练即可改善序列级探索。
  • 2.3PO 通过采样策略让 RLVR rollout 更多样。
  • 3.RISE-RL 针对反复遗漏的评分标准进行探索。

多篇 arXiv 论文介绍了提升大型语言模型探索能力的新方法。DORA Explorer 是一种无需训练、在推理时运行的算法:它会生成多个候选动作,用序列级 log-probability 统计对其打分,并通过可调探索参数进行采样。3PO 面向 RLVR,在参数空间中探索,通过从后验分布中采样不同策略来实现;RISE-RL 则利用反复遗漏的评分标准,引导开放式 RL 中的选择性探索。

今天就能用

在仅依赖温度参数进行智能体探索或 RL rollout 之前,建议先阅读 DORA 和 3PO 论文。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究