Pesquisadores miram falhas de destilação on-policy em agentes
Artigos recentes no arXiv propõem ajustes de treinamento sensíveis a turno, etapa e prefixo para agentes LLM que usam ferramentas.
Por que importa
O trabalho reflete uma mudança mais ampla: sair do aprendizado por reforço baseado apenas no resultado e avançar para uma supervisão mais densa e sensível ao estado no treinamento de agentes. Isso importa porque agentes que usam ferramentas frequentemente falham ao longo de vários turnos, e recompensas grosseiras por trajetória podem não identificar qual etapa ou chamada de ferramenta causou a falha.
Pontos-chave
- 1.Novos métodos reponderam a destilação por qualidade de turno, etapa, prefixo ou amostra.
- 2.Os artigos atacam recompensas esparsas e sinais de professor pouco confiáveis em longas trajetórias de agentes.
- 3.Erros em chamadas de ferramentas podem se propagar em cascata, enfraquecendo a supervisão do professor em nível de token.
Um conjunto de artigos recentes no arXiv propõe novas formas de treinar agentes de modelos de linguagem integrados a ferramentas e capazes de operar em múltiplos turnos, usando destilação on-policy e aprendizado por reforço. Os métodos incluem TurnSight, SOD, ATOD, PG-OPD e RSTG, todos voltados a problemas de confiabilidade como recompensas esparsas, erros em cascata nas chamadas de ferramentas, divergência entre professor e aluno, rollouts longos ineficientes e perda de gradientes em grupos de recompensa com variância zero. Os artigos relatam experimentos em tarefas de raciocínio de longo horizonte, matemática, ciência, código e agentes interativos, mas os resumos fornecidos não estabelecem um único líder de benchmark entre todos os métodos.
⚡ Experimente hoje
Se você está treinando agentes que usam ferramentas, audite se a supervisão do professor é condicionada pela qualidade da etapa ou do turno antes de combinar OPD com RL.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AITurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.AIRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.AIDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.AIGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.AIPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIDAPD: Dual-Anchored Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.AIIs More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled ReasoningAug 4, 12:00 PM↗
- arXiv cs.LGGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- HF Daily PapersTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 4, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores apresentam o TTP-D para roteirização com caminhões e drones
O novo benchmark combina seleção de itens, rotas dependentes da carga e sincronização de drones.
Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes
O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.
AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes
Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.