AAI News Hub
RechercheTue, August 4, 2026·Aug 42 sources corroborating

OneDayAgent teste des workflows d’agents autonomes sur le long terme

Le banc d’essai gère la décomposition des tâches, la mémoire et la vérification sur 104 tâches de référence.

Pourquoi c'est important

Ces travaux s’attaquent à des modes d’échec persistants des systèmes agentiques, notamment la dérive des objectifs, la perte d’état et le dépassement de contexte. Les performances rapportées sur cinq LLM backend issus de trois familles de modèles suggèrent que la conception du banc d’essai pourrait améliorer la fiabilité sur le long terme indépendamment d’un modèle unique.

Points clés

  • 1.OneDayAgent gère la décomposition, la mémoire et la vérification finale.
  • 2.Il a obtenu 0,821 sur 104 tâches AgentIF-OneDay avec GLM-5.2.
  • 3.Le banc d’essai a fonctionné avec cinq LLM backend issus de trois familles de modèles.

Des chercheurs ont présenté OneDayAgent, un banc d’essai pour agents autonomes chargés de traiter des demandes quotidiennes ouvertes, dans le travail, les études et la vie courante. Le système décompose les requêtes en sous-tâches délimitées, maintient une mémoire d’exécution malgré la pression sur le contexte, puis vérifie et corrige les livrables finaux. Sur AgentIF-OneDay, il a été évalué sur 104 tâches et a atteint un score global de 0,821 avec le backend GLM-5.2.

À tester aujourd'hui

Lisez l’article avant de concevoir des agents à long horizon qui doivent préserver les objectifs, la mémoire et la qualité des livrables au fil de nombreuses étapes.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche