研究测试 LLM 智能体如何学习并复用技能
新的基准测试正在探究自我进化型智能体能否通过可复用技能、记忆和检索实现改进。
为什么重要
这些论文表明,智能体的自我改进并不只是增加技能库这么简单;检索方式、记忆设计、模型能力和评测环境都会影响收益能否持续。它们也指向一个趋势:智能体评测正从静态基准转向连续、流式和更接近生产环境的评估。
核心要点
- 1.连续任务经验可以提升智能体表现,但收益会因模型和领域而异。
- 2.显式技能在可复用流程和精确输出任务中帮助最大。
- 3.结构化技能检索优于把每项技能当作一份扁平文档来处理。
多篇新的 arXiv 论文考察了 LLM 智能体如何在连续任务中提升表现,涉及 ContinualSkillBench、AgentStream、领域感知技能检索、ECHO,以及一个自我进化的推荐系统。ContinualSkillBench 报告称,按序执行任务通常能提升表现,但从平均水平看,上下文学习的效果与显式维护技能相当;显式技能主要在可复用流程或需要精确输出的任务中有选择性地发挥作用。其他研究发现,将技能字段分开保存能提升技能检索效果;流式任务的可靠性会因模型和场景而异;可追踪记忆则可在有限上下文中支持智能体强化学习。
⚡ 今天就能用
在依赖技能库作为可复用记忆之前,应先用连续任务和流式任务评估智能体技能系统。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.CLContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?Aug 5, 12:00 PM↗
- arXiv cs.LGContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?Aug 5, 12:00 PM↗
- arXiv cs.LGField Aware Agent Skill RetrievalAug 5, 12:00 PM↗
- arXiv cs.LGAgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?Aug 5, 12:00 PM↗
- arXiv cs.AIECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RLAug 4, 12:00 PM↗
- arXiv cs.AISelf-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM AgentsAug 4, 12:00 PM↗
- arXiv cs.AIAdaHAT: Adaptive Hard Attention to the Task in Task-Incremental LearningAug 4, 12:00 PM↗
- arXiv cs.AICooperative Coevolution for Resource-Constrained Agentic LLM Post-TrainingAug 4, 12:00 PM↗
- arXiv cs.AISKT: Skill-Use Training at Scale via Verified Synthetic Data GenerationAug 4, 12:00 PM↗
- arXiv cs.AIPATH-Bench: Path-Dependent Evaluation of Lifelong AgentsAug 4, 12:00 PM↗
- arXiv cs.AIAgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?Aug 4, 12:00 PM↗
- arXiv cs.LGECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RLAug 4, 12:00 PM↗
- arXiv cs.LGSelf-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM AgentsAug 4, 12:00 PM↗
- arXiv cs.LGCooperative Coevolution for Resource-Constrained Agentic LLM Post-TrainingAug 4, 12:00 PM↗
- arXiv cs.LGProgressive Agent Skill Generation via Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGAdaHAT: Adaptive Hard Attention to the Task in Task-Incremental LearningAug 4, 12:00 PM↗
- arXiv cs.CLProgressive Agent Skill Generation via Reinforcement LearningAug 4, 12:00 PM↗
- HF Daily PapersContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?Aug 4, 4:00 AM↗
- HF Daily PapersSKT: Skill-Use Training at Scale via Verified Synthetic Data GenerationAug 3, 4:00 AM↗
- HF Daily PapersProgressive Agent Skill Generation via Reinforcement LearningAug 3, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。