SkillGate cible la sélection des compétences dans les agents à horizon long
L’article propose des canaux de crédit distincts pour le choix et l’exécution des compétences d’agent.
Pourquoi c'est important
À mesure que les systèmes d’agents s’appuient sur des bibliothèques de compétences plus vastes, choisir la bonne compétence devient une décision de politique plutôt qu’une étape d’orchestration figée. Ce travail met en lumière un mode d’échec de l’entraînement susceptible d’affecter la fiabilité des agents à horizon long.
Points clés
- 1.La sélection des compétences est présentée comme une décision in-policy pendant les épisodes d’agent.
- 2.Le RL récompensé sur le résultat peut mal attribuer le crédit aux tokens de choix des compétences.
- 3.SkillGate sépare le crédit accordé au choix des compétences de celui accordé à leur exécution.
Un nouvel article, « SkillGate », soutient que les frameworks d’agents à horizon long manquent d’un signal d’entraînement pour décider quel fichier de compétence procédurale lire au cours d’un épisode. Les auteurs identifient une « privation de crédit du sélecteur », dans laquelle l’apprentissage par renforcement récompensé sur le résultat accorde trop peu de crédit aux tokens de sélection des compétences, avec un crédit de plus en plus mal attribué à mesure que les trajectoires s’allongent. SkillGate répond à ce problème en séparant le crédit lié au résultat pour les tokens d’exécution d’un avantage local à l’action pour les tokens qui nomment les compétences.
⚡ À tester aujourd'hui
Lisez l’article avant d’entraîner des agents qui sélectionnent parmi de grandes bibliothèques de compétences avec des récompenses RL au niveau de la séquence.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une startup affirme que les données sont essentielles aux avancées de l’IA contre le cancer
Selon TechCrunch, la startup estime que l’IA est encore loin de guérir le cancer sans de meilleures données.
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.