ABSeeker cible l’attribution du crédit pour les agents de recherche
L’article publié sur arXiv propose une supervision au niveau des étapes pour les agents de recherche à long horizon.
Pourquoi c'est important
Ce travail s’inscrit dans un effort de recherche plus large visant à améliorer les agents en attribuant le crédit aux étapes intermédiaires de recherche et de raisonnement, plutôt qu’en s’appuyant uniquement sur les récompenses liées à la réponse finale. Une meilleure supervision au niveau du processus pourrait réduire les comportements de recherche redondants ou erronés dans les systèmes d’IA multi-étapes.
Points clés
- 1.ABSeeker convertit la supervision fondée sur la réponse finale en récompenses au niveau des étapes.
- 2.ABC récompense les actions utiles, y compris celles présentes dans des trajectoires échouées.
- 3.Des articles connexes ciblent également des signaux de crédit denses pour les agents de récupération d’informations.
Un nouvel article sur arXiv présente ABSeeker, un cadre destiné à entraîner des agents de recherche à long horizon capables d’effectuer, de manière séquentielle, recherche, récupération d’informations, vérification et intégration des preuves. L’article propose l’Answer-Backtracked Credit Assignment, qui part d’une réponse de référence pour retrouver les indices intermédiaires et évaluer les étapes de recherche à leur aune, transformant des résultats de trajectoires épars en récompenses au niveau des étapes. Cette approche est présentée aux côtés de travaux connexes sur l’attribution du crédit pour les agents augmentés par la récupération et la recherche, notamment RICE-PO et BiCAA.
⚡ À tester aujourd'hui
Lisez l’article sur ABSeeker avant d’entraîner des agents de recherche avec des récompenses SFT ou RL fondées uniquement sur le résultat final.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit AssignmentAug 6, 12:00 PM↗
- HF Daily PapersABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit AssignmentAug 5, 4:00 AM↗
- arXiv cs.LGCredit Assignment and Efficient Exploration based on Influence Scope in Multi-agent Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.CLRICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning AgentsAug 4, 12:00 PM↗
- arXiv cs.CLBiCAA: Bidirectional Credit Assignment for Search-Augmented AgentAug 4, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs ciblent les lacunes du raisonnement spatial des VLM
De nouveaux articles proposent mémoire, RL et benchmarks pour renforcer l’intelligence spatiale des systèmes vision-langage.
De nouvelles études explorent l’intelligence spatiale dans l’IA visuelle
SpaRRTa, SMA et PinpointQA testent ou améliorent le raisonnement spatial des systèmes d’IA visuelle et incarnée.
CW-BASS v2 cible la sélection de pseudo-étiquettes avec DINOv2
La méthode adapte le filtrage pour la segmentation semi-supervisée sous l’égide de modèles de fondation enseignants.