AAI News Hub
RechercheMon, August 3, 2026·Aug 3

LongHorizon-Harness cible l’état des agents sur longue durée

Ce banc de recherche sépare l’état de la tâche de son exécution et vérifie les mises à jour au moyen d’une boucle d’audit.

Pourquoi c'est important

Ces travaux s’attaquent à un mode de défaillance central des agents de longue durée : l’accumulation d’erreurs dues à des auto-évaluations obsolètes ou incorrectes. Une gestion explicite de l’état, vérifiée de façon indépendante, pourrait rendre les systèmes d’agents plus fiables dans les workflows fortement dépendants des outils.

Points clés

  • 1.LongHorizon-Harness stocke l’état des tâches en dehors du contexte d’exécution.
  • 2.La boucle MEA vérifie les mises à jour avant la sous-tâche suivante.
  • 3.Les gains de benchmark rapportés incluent Qwen 3.7-Plus sur WeaveBench.

Des chercheurs ont proposé LongHorizon-Harness, un cadre destiné aux agents LLM de longue durée qui gère l’état des tâches en dehors du contexte croissant du modèle. Sa boucle Manage-Execute-Audit s’appuie sur un manager pour choisir les sous-tâches, un exécuteur à contexte frais pour agir, et un auditeur en lecture seule pour vérifier l’état de l’environnement avant de mettre à jour le dossier de tâche. L’article fait état de progrès pour Qwen 3.7-Plus sur WeaveBench, Terminal-Bench 2.1 et OSWorld 2.0.

À tester aujourd'hui

Pour construire des agents de longue durée, séparez l’état de la tâche du contexte d’exécution et vérifiez les changements d’état par rapport à l’environnement avant de poursuivre.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche