AAI News Hub
研究Thu, August 6, 2026·Aug 62 家媒体交叉佐证

研究人员测试 LLM 智能体的新训练方法

State2State、EnvACE 和 OASE 瞄准智能体学习,试图避免更重的人工监督或静态假设。

为什么重要

这些工作反映出一个趋势:减少智能体训练对专家轨迹、手工设计任务和高成本可执行环境的依赖。它也显示,研究界正越来越关注必须在不断变化的多智能体条件下学习的智能体,而不仅仅是静态基准。

核心要点

  • 1.State2State 从环境探索中衍生出可验证的目标状态任务。
  • 2.EnvACE 通过内部生成的环境响应来训练智能体。
  • 3.OASE 根据历史对手快照评估技能修订。

三篇新的研究报告提出了通过环境衍生数据或交互感知训练来改进 LLM 智能体的方法。State2State 将已探索的环境状态转化为目标状态任务,并报告其在 ALFWorld 和 ScienceWorld 上取得提升,包括作为下游强化学习的初始化方法。EnvACE 在训练期间用“世界预演”取代与外部环境的交互,并报告其在 BFCL-v4、tau^2-Bench、VitaBench 和 FinMCP-Bench 上展现出较强的可迁移表现。OASE 面向动态多智能体场景,只有在基于历史、并与对手策略快照比较后,才接受技能修订。

今天就能用

在采用依赖人工任务设计、外部模拟器或静态对手假设的智能体训练流程之前,先阅读这些论文。

来源与原始报道

本简报汇总并链接到以下媒体的报道。

觉得这篇简报有用?下一篇直接送到你的邮箱。

更多 研究