LongHorizon-Harness cible l’état des agents sur longue durée
Ce banc de recherche sépare l’état de la tâche de son exécution et vérifie les mises à jour au moyen d’une boucle d’audit.
Pourquoi c'est important
Ces travaux s’attaquent à un mode de défaillance central des agents de longue durée : l’accumulation d’erreurs dues à des auto-évaluations obsolètes ou incorrectes. Une gestion explicite de l’état, vérifiée de façon indépendante, pourrait rendre les systèmes d’agents plus fiables dans les workflows fortement dépendants des outils.
Points clés
- 1.LongHorizon-Harness stocke l’état des tâches en dehors du contexte d’exécution.
- 2.La boucle MEA vérifie les mises à jour avant la sous-tâche suivante.
- 3.Les gains de benchmark rapportés incluent Qwen 3.7-Plus sur WeaveBench.
Des chercheurs ont proposé LongHorizon-Harness, un cadre destiné aux agents LLM de longue durée qui gère l’état des tâches en dehors du contexte croissant du modèle. Sa boucle Manage-Execute-Audit s’appuie sur un manager pour choisir les sous-tâches, un exécuteur à contexte frais pour agir, et un auditeur en lecture seule pour vérifier l’état de l’environnement avant de mettre à jour le dossier de tâche. L’article fait état de progrès pour Qwen 3.7-Plus sur WeaveBench, Terminal-Bench 2.1 et OSWorld 2.0.
⚡ À tester aujourd'hui
Pour construire des agents de longue durée, séparez l’état de la tâche du contexte d’exécution et vérifiez les changements d’état par rapport à l’environnement avant de poursuivre.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.
Les outils et pratiques de développement IA suscitent le débat sur Hacker News
Des publications sur MathCode, les habitudes de codage avec l’IA, Cloudflare et HEIR de Google ont alimenté les discussions.
Google fait progresser l’IA privée grâce au chiffrement homomorphe
Google affirme rendre l’IA privée plus concrètement utilisable grâce au chiffrement homomorphe.