Des chercheurs s’attaquent à l’attribution du crédit pour les agents de recherche
De nouveaux articles proposent des signaux d’entraînement plus denses pour les agents de recherche, de retrieval et de raisonnement en plusieurs étapes.
Pourquoi c'est important
Ces articles reflètent un effort de recherche plus large visant à rendre l’entraînement des agents moins dépendant des récompenses liées à la réponse finale, qui peuvent masquer les étapes ayant aidé ou nui aux performances. Une meilleure attribution du crédit au niveau des étapes ou des tours pourrait améliorer la fiabilité dans les workflows de recherche, de retrieval, de programmation, de mathématiques et d’utilisation d’outils.
Points clés
- 1.De nouvelles méthodes attribuent le crédit aux étapes intermédiaires des agents, pas seulement aux réponses finales.
- 2.Des articles sur la recherche, le retrieval, le RL multi-tours et le MARL s’attaquent à des problèmes similaires de récompenses rares.
- 3.Les évaluations rapportées couvrent les mathématiques, le code, AppWorld, BRIGHT, BEIR et des tâches multi-agents.
Plusieurs articles arXiv nouveaux ou mis à jour proposent des méthodes pour améliorer l’attribution du crédit dans les agents IA à horizon long. ABSeeker, BiCAA et RICE-PO se concentrent sur des agents augmentés par la recherche ou le retrieval, tandis que TCPO porte sur l’apprentissage par renforcement multi-tours guidé par vérificateur et ISA vise l’apprentissage par renforcement multi-agent à récompenses rares. Leur objectif commun est de remplacer ou de compléter les récompenses clairsemées au niveau du résultat par des signaux plus localisés pour les actions intermédiaires, les tours ou les étapes de raisonnement.
⚡ À tester aujourd'hui
Si vous entraînez des agents de recherche ou de retrieval, comparez les récompenses fondées uniquement sur le résultat aux méthodes d’attribution du crédit par étape ou par tour avant de passer à l’échelle vos exécutions RL.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit AssignmentAug 6, 12:00 PM↗
- HF Daily PapersABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit AssignmentAug 5, 4:00 AM↗
- arXiv cs.AITCPO: Turn-Level Credit Policy OptimizationAug 4, 12:00 PM↗
- arXiv cs.LGCredit Assignment and Efficient Exploration based on Influence Scope in Multi-agent Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.CLRICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning AgentsAug 4, 12:00 PM↗
- arXiv cs.CLBiCAA: Bidirectional Credit Assignment for Search-Augmented AgentAug 4, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.