IBM teste la quantité de mémoire nécessaire aux agents d’IA
Une étude sur ALTK-Evolve montre que les gains liés à la mémoire des agents dépendent des capacités du modèle et de la stratégie de diffusion.
Pourquoi c'est important
Ces résultats suggèrent que la mémoire des agents doit être considérée comme un choix de conception système propre à chaque modèle, et non comme une fonctionnalité universelle. Pour les agents en production, la stratégie de mémoire peut influer à la fois sur la fiabilité et sur le coût d’inférence.
Points clés
- 1.ALTK-Evolve ajoute de la mémoire aux agents sans mettre à jour les poids du modèle.
- 2.Les gains liés à la mémoire varient selon les capacités du modèle et la marge de progression sur les tâches.
- 3.La récupération organisée a amélioré gpt-oss-120b avec un surcoût de 5 % en tokens.
IBM Research affirme que son système ALTK-Evolve a amélioré les performances des agents d’IA en distillant des lignes directrices réutilisables à partir de trajectoires précédentes, puis en les injectant au moment de l’inférence, sans mise à jour des poids ni annotation humaine. Dans une évaluation AppWorld couvrant 585 tâches en plusieurs étapes sur huit modèles, les modèles les plus solides qui disposaient encore d’une marge de progression ont le plus bénéficié de l’ensemble complet de lignes directrices, tandis que les modèles plus faibles ont obtenu de meilleurs résultats avec un noyau compact complété par une récupération propre à la tâche. Le billet indique également que gpt-oss-120b a gagné 16,1 points de pourcentage en taux d’achèvement des tâches avec une récupération organisée, pour un surcoût de 5 % en tokens, tandis que GLM-5 n’a affiché aucun gain mesurable.
⚡ À tester aujourd'hui
Évaluez à la fois la mémoire complète et la mémoire fondée sur la récupération sur les tâches de vos agents avant d’élargir le contexte par défaut.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une startup affirme que les données sont essentielles aux avancées de l’IA contre le cancer
Selon TechCrunch, la startup estime que l’IA est encore loin de guérir le cancer sans de meilleures données.
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.