PolicyGuide guide les agents LLM dans des workflows conformes
Ce système de recherche transforme les politiques propres à un domaine en graphes de workflow afin d’orienter le comportement d’agents dans des tâches en plusieurs étapes.
Pourquoi c'est important
Ces travaux s’attaquent à un problème central du déploiement des agents IA : respecter des exigences procédurales, et pas seulement bloquer des actions interdites. Ils suggèrent que la conformité aux politiques peut nécessiter un état au niveau du workflow et des mécanismes de remédiation, plutôt que de simples contrôles d’exécution action par action.
Points clés
- 1.Compile les politiques d’un domaine en graphes de workflow pour guider les agents.
- 2.A amélioré le Pass^4 moyen de 0,42 à 0,62 sur τ^2-bench.
- 3.Les workflows ont été transférés à des agents Claude Sonnet 4.6 et Gemini 2.5 Pro.
PolicyGuide est un système proposé pour les agents LLM de service client : il compile les politiques organisationnelles en graphes de workflow et s’appuie sur un vérificateur proactif aux frontières de chaque tour utilisateur. Lors de tests τ^2-bench dans l’aérien, la distribution et les télécoms avec un agent et un vérificateur GPT-5.4, il a fait progresser le Pass^4 moyen de 0,42 à 0,62, avec le gain le plus marqué dans les télécoms, de 0,19 à 0,61. Les mêmes workflows ont été transférés à des agents Claude Sonnet 4.6 et Gemini 2.5 Pro.
⚡ À tester aujourd'hui
Lisez l’article avant de déployer des agents de service client qui doivent suivre des politiques organisationnelles en plusieurs étapes.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.LGPolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM AgentsAug 21, 12:00 PM↗
- arXiv cs.CLPolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM AgentsAug 21, 12:00 PM↗
- HF Daily PapersPolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM AgentsAug 20, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Google DeepMind s’associe à des studios de jeux autour du gameplay IA
Le laboratoire affirme s’appuyer sur 15 ans de recherche sur les jeux pour prototyper du gameplay IA.
MemTrapBench teste les pièges cognitifs liés à l’usage de la mémoire par les LLM
Le benchmark montre que la mémoire peut dégrader les performances, même lorsque les éléments retrouvés sont pertinents.
AI4AI-Bench teste les agents sur la conception d’algorithmes d’entraînement
Ce benchmark publié sur arXiv évalue si des agents LLM peuvent réécrire des algorithmes d’entraînement dans des dépôts figés.