SKILL-KD cible la distillation de compétences pour les agents LLM
Le framework transforme les écarts entre trajectoires enseignant-étudiant en correctifs textuels de compétences réutilisables.
Pourquoi c'est important
Ces travaux s’attaquent à une faiblesse pratique du prompting fondé sur les compétences : les agents moins performants peuvent ne pas fournir assez d’indices dans leurs exécutions échouées pour inférer les stratégies manquantes. Traiter les compétences comme un support explicite de distillation pourrait rendre l’amélioration des agents plus systématique malgré les écarts de capacité.
Points clés
- 1.SKILL-KD compare les échecs de l’étudiant avec les trajectoires de l’enseignant.
- 2.Les correctifs textuels de compétences sont testés en relançant l’agent étudiant.
- 3.La Drift-Aware Skill Consolidation gère les mises à jour locales répétées.
Des chercheurs ont proposé SKILL-KD, un framework de distillation contrastive de compétences pour les agents LLM. La méthode compare la trajectoire échouée d’un étudiant avec celle d’un enseignant sur la même tâche, distille l’écart exploitable en un correctif textuel de compétence, relance l’étudiant pour l’évaluer, puis affine le correctif de façon itérative si les échecs persistent. Elle utilise aussi des historiques de modifications liés aux traces et la Drift-Aware Skill Consolidation pour gérer les mises à jour répétées des compétences.
⚡ À tester aujourd'hui
Lisez l’article avant d’adopter des mises à jour de mémoire de compétences pour des agents qui apprennent à partir de trajectoires échouées.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.