Novos artigos testam autodestilação para RL agêntico
AgentOPSD e OCSD propõem correções, enquanto outro estudo mostra que professores privilegiados podem falhar em tarefas mais difíceis.
Por que importa
Os artigos apontam a atribuição de crédito e a supervisão privilegiada enviesada como questões centrais ainda não resolvidas no RL agêntico. Eles também sugerem que uma perda de destilação menor não é evidência suficiente de que um agente esteja aprendendo um comportamento melhor.
Pontos-chave
- 1.O AgentOPSD mira a atribuição de crédito no nível dos turnos sem crítico nem rollouts extras.
- 2.O OCSD tenta remover a confusão criada pelo andaime de replay nos sinais de observação privilegiada.
- 3.Um estudo sobre viés mostra que a autodestilação pode degradar a acurácia de validação em tarefas mais difíceis.
Três artigos no arXiv examinam métodos de autodestilação para treinar agentes baseados em modelos de linguagem com recompensas esparsas de aprendizado por reforço. O AgentOPSD propõe um método recursivo sem crítico para atribuição de crédito no nível dos turnos e relata avaliações no ALFWorld, WebShop e Search-QA usando modelos Qwen2.5 de 3B e 7B. O OCSD propõe contrastar visões de replay completas e com observações removidas para isolar a supervisão de observações futuras, enquanto um artigo separado argumenta que professores condicionados por informação privilegiada podem reduzir a perda por token sem melhorar, e muitas vezes piorando, a acurácia de validação em tarefas mais difíceis.
⚡ Experimente hoje
Antes de adotar autodestilação ao estilo OPSD, valide em tarefas agênticas difíceis e separadas do treino, e acompanhe a acurácia nas tarefas, não apenas a perda por token.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.LGAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- HF Daily PapersAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 6, 4:00 AM↗
- arXiv cs.AITurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.AIRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.LGWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGWhen Correct Solutions Repeat: Rarity-Aware Credit Redistribution for GRPOAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
InternLM propõe a arquitetura de modelo Mobius
O artigo no arXiv separa memória e raciocínio para melhorar a compressão e a eficiência na inferência.
Ferramentas e práticas de IA para desenvolvedores geram debate no Hacker News
Posts sobre MathCode, hábitos de programação com IA, Cloudflare e o HEIR do Google puxaram a discussão.
Google avança em IA privada com criptografia homomórfica
O Google afirma estar tornando a IA privada mais prática com o uso de criptografia homomórfica.