De nouveaux benchmarks testent si les agents LLM peuvent s’auto-améliorer
ContinualSkillBench et AgentStream évaluent la réutilisation des compétences, la récupération d’information et la fiabilité des agents en évolution.
Pourquoi c'est important
Ces résultats nuancent l’idée selon laquelle les bibliothèques de compétences des agents produiraient automatiquement une auto-amélioration durable. Ils suggèrent que les concepteurs d’agents doivent évaluer plus rigoureusement la réutilisation des compétences, la récupération d’information et la provenance de la mémoire avant de s’appuyer sur des systèmes auto-évolutifs en production.
Points clés
- 1.L’exposition séquentielle aux tâches peut améliorer les agents, mais les résultats varient selon les modèles et les domaines.
- 2.Les compétences explicites aident de manière sélective, surtout pour les procédures réutilisables ou les sorties précises.
- 3.La récupération des compétences et une mémoire traçable restent des goulets d’étranglement majeurs pour les agents capables d’apprentissage continu.
Plusieurs nouveaux articles publiés sur arXiv évaluent la capacité des agents LLM à progresser grâce à l’expérience accumulée, à des bibliothèques de compétences externes et à une exposition continue à des tâches. ContinualSkillBench présente un benchmark couvrant cinq domaines, avec 100 sous-tâches connectées par domaine, et constate que l’exécution séquentielle améliore souvent les performances, même si les gains varient selon les modèles et les domaines. Les travaux connexes indiquent aussi que la maintenance explicite des compétences n’est pas systématiquement meilleure que l’adaptation en contexte, tandis que la récupération de compétences sensible au domaine et les méthodes de mémoire sélective peuvent aider dans des cadres plus restreints.
⚡ À tester aujourd'hui
Comparez les bibliothèques de compétences à un simple historique en contexte avant d’ajouter une maintenance explicite des compétences à une pile d’agents.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?Aug 5, 12:00 PM↗
- arXiv cs.CLContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?Aug 5, 12:00 PM↗
- arXiv cs.LGContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?Aug 5, 12:00 PM↗
- arXiv cs.LGField Aware Agent Skill RetrievalAug 5, 12:00 PM↗
- arXiv cs.LGAgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?Aug 5, 12:00 PM↗
- arXiv cs.AIECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RLAug 4, 12:00 PM↗
- arXiv cs.AISelf-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM AgentsAug 4, 12:00 PM↗
- arXiv cs.AIAdaHAT: Adaptive Hard Attention to the Task in Task-Incremental LearningAug 4, 12:00 PM↗
- arXiv cs.AICooperative Coevolution for Resource-Constrained Agentic LLM Post-TrainingAug 4, 12:00 PM↗
- arXiv cs.AISKT: Skill-Use Training at Scale via Verified Synthetic Data GenerationAug 4, 12:00 PM↗
- arXiv cs.AIPATH-Bench: Path-Dependent Evaluation of Lifelong AgentsAug 4, 12:00 PM↗
- arXiv cs.AIAgentStream: How Well Do Self-Evolving LLM Agents Perform Under Streaming Tasks?Aug 4, 12:00 PM↗
- arXiv cs.LGECHO: Prune To Act, Trace To Learn With Selective Turn Memory In Agentic RLAug 4, 12:00 PM↗
- arXiv cs.LGSelf-Evolving Recommendation System: End-To-End Autonomous Model Optimization With LLM AgentsAug 4, 12:00 PM↗
- arXiv cs.LGCooperative Coevolution for Resource-Constrained Agentic LLM Post-TrainingAug 4, 12:00 PM↗
- arXiv cs.LGProgressive Agent Skill Generation via Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGAdaHAT: Adaptive Hard Attention to the Task in Task-Incremental LearningAug 4, 12:00 PM↗
- arXiv cs.CLProgressive Agent Skill Generation via Reinforcement LearningAug 4, 12:00 PM↗
- HF Daily PapersContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?Aug 4, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.