EnvACE 和 State2State 瞄准可扩展的 LLM 智能体训练
两篇 arXiv 论文提出了减少对人工构建任务、验证器和可执行环境依赖的方法。
为什么重要
这些论文回应了智能体开发中的一个核心瓶颈:如何在不依赖高成本可执行环境、手工验证器或专家示范的情况下,扩展长程工具使用训练。如果这些方法能在已报告的基准之外得到验证,它们可能让智能体训练更具迁移性,并减少对定制化环境工程的依赖。
核心要点
- 1.EnvACE 通过自生成的世界预演来训练智能体。
- 2.State2State 从已探索的环境状态中推导智能体目标。
- 3.两种方法都旨在减少智能体训练中的人工监督。
两篇新的 arXiv 论文提出了面向 LLM 智能体的训练方法,旨在降低对外部指定监督的依赖。EnvACE 在训练中用“世界预演”取代与外部环境的交互:策略会生成工具调用、模拟环境响应,并通过任务成功奖励同时优化这两种角色。State2State 则把已探索的环境状态转化为目标状态任务,使用基于规则的状态匹配,而不是依赖专家轨迹或人工任务设计;论文报告其在 ALFWorld 和 ScienceWorld 上取得了提升。
⚡ 今天就能用
在设计依赖手工环境或专家轨迹的新 LLM 智能体训练流水线之前,建议先阅读 EnvACE 和 State2State 论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AIEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- arXiv cs.LGState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- HF Daily PapersEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 6, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。