Pesquisadores miram a atribuição de crédito em agentes de busca
Novos artigos propõem métodos de recompensa em nível de etapa para agentes de recuperação e busca de longo horizonte.
Por que importa
O trabalho aborda um problema central no treinamento de agentes de raciocínio e busca: resultados finais, por si só, podem ocultar quais ações intermediárias ajudaram. Uma supervisão melhor em nível de etapa poderia aumentar a confiabilidade dos agentes em fluxos de trabalho de recuperação e coleta de evidências em várias etapas.
Pontos-chave
- 1.O RICE-PO localiza recompensas em torno das interações de recuperação.
- 2.O ABSeeker retrocede a partir das respostas para pontuar etapas de busca.
- 3.Ambos os métodos miram supervisão densa para agentes de múltiplas etapas.
Dois artigos no arXiv apresentam métodos para atribuir crédito de forma mais precisa em agentes de IA que recuperam, buscam, verificam e integram evidências ao longo de várias etapas. O RICE-PO converte interações de recuperação em sinais de aprendizado localizados, ancorando-se em ações executáveis de alta incerteza e propagando crédito para etapas latentes de raciocínio sob condições especificadas de influência e estabilidade. O ABSeeker propõe a Answer-Backtracked Credit Assignment, que rastreia a partir de uma resposta de referência até pistas intermediárias e pontua etapas individuais de busca para recompensar ações úteis enquanto reduz o peso de ações errôneas ou redundantes.
⚡ Experimente hoje
Leia os artigos antes de treinar agentes de busca usando apenas SFT em nível de trajetória ou recompensas de RL.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.CLRICE-PO: Turning Retrieval Interactions into Credit Signals for Reasoning AgentsAug 7, 12:00 PM↗
- arXiv cs.AIABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit AssignmentAug 6, 12:00 PM↗
- HF Daily PapersABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit AssignmentAug 5, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.