Novos estudos testam autodestilação no aprendizado por reforço de LLMs
Pesquisas propõem ICE e OCSD, enquanto outro estudo mostra que professores com informações privilegiadas podem falhar em tarefas mais difíceis.
Por que importa
Os artigos apontam para uma visão mais nuançada da autodestilação no pós-treinamento de LLMs: ela pode ajudar quando combinada com exploração ou calibração, mas também pode otimizar perdas por token sem melhorar a acurácia nas tarefas. Isso importa para equipes que usam supervisão densa como alternativa mais barata, ou complemento, ao RL baseado em recompensas.
Pontos-chave
- 1.O ICE melhorou o pass@1 matemático do Qwen3-1.7B em 5,0% em relação ao DAPO.
- 2.O ganho relatado do ICE não apareceu para o Qwen3-4B em 4K.
- 3.A autodestilação com informações privilegiadas pode reduzir a perda enquanto prejudica a acurácia de validação.
Vários novos artigos no arXiv examinam métodos de autodestilação para o pós-treinamento de grandes modelos de linguagem com aprendizado por reforço. Um deles propõe o Instruction-Conditioned Exploration, que adiciona instruções fixas de treinamento e destila rollouts corretos em uma política não condicionada para uso em teste, relatando ganho relativo de 5,0% no pass@1 em dados reservados em relação ao DAPO para o Qwen3-1.7B em raciocínio matemático com respostas de 4K de comprimento. Outro propõe o Observation-Calibrated Self-Distillation para RL agêntico, enquanto um terceiro relata que a autodestilação com informações privilegiadas consegue reproduzir ganhos em cenários fáceis, mas muitas vezes não melhora, e pode até reduzir, a acurácia de validação em tarefas mais difíceis de QA, matemática, programação e uso de ferramentas.
⚡ Experimente hoje
Antes de adotar autodestilação no pós-treinamento de LLMs, valide o método em tarefas difíceis reservadas e acompanhe a acurácia, não apenas a perda por token.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.CLInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.AIPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGPrivileged, but Biased: How PI-Conditioned Teachers Break Self-DistillationAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Observation-Calibrated Self-DistillationAug 6, 12:00 PM↗
- HF Daily PapersAgentOPSD: Recursive Self-Distillation for Agentic Reinforcement LearningAug 6, 4:00 AM↗
- arXiv cs.AITurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.AIAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.AIRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.CLAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.CLTurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGAgentic Reinforcement Learning with Self-Distilled Reward ShapingAug 5, 12:00 PM↗
- arXiv cs.LGRubrics as Privileged Information for Open-Ended GenerationAug 5, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.AIDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.AIGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.AIPCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.AIDAPD: Dual-Anchored Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.AITCPO: Turn-Level Credit Policy OptimizationAug 4, 12:00 PM↗
- arXiv cs.AIIs More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled ReasoningAug 4, 12:00 PM↗
- arXiv cs.LGGroup-Reflective Self-Distillation for Agentic Reinforcement LearningAug 4, 12:00 PM↗
- arXiv cs.LGDRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer TrainingAug 4, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
- arXiv cs.LGRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLRoMeRL: Balancing Feedback Coverage and the Memory-Reward Trap in Self-Evolving Agent Memory via Reduced-Order Utility StatesAug 4, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-DistillationAug 4, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
InternLM propõe a arquitetura de modelo Mobius
O artigo no arXiv separa memória e raciocínio para melhorar a compressão e a eficiência na inferência.
Ferramentas e práticas de IA para desenvolvedores geram debate no Hacker News
Posts sobre MathCode, hábitos de programação com IA, Cloudflare e o HEIR do Google puxaram a discussão.
Google avança em IA privada com criptografia homomórfica
O Google afirma estar tornando a IA privada mais prática com o uso de criptografia homomórfica.