Pesquisadores refinam destilação on-policy para agentes
Três artigos no arXiv propõem formas de testar quando a orientação de um professor melhora as trajetórias do aluno.
Por que importa
O trabalho aponta para uma abordagem mais seletiva na destilação de comportamento agentivo e de raciocínio, em que a discordância local entre modelos não é tratada como evidência suficiente para intervenção. Isso pode ser relevante para criar modelos menores que preservem o desempenho em tarefas posteriores sem copiar todas as preferências do professor.
Pontos-chave
- 1.O FutureBridge-OPD relata ganhos no ALFWorld, WebShop e ScienceWorld.
- 2.O SPOT aloca sondagens limitadas usando entropia, massa top-k e incompatibilidade entre professor e aluno.
- 3.Rótulos de recuperabilidade distinguem erros corrigíveis de estados que exigem reversão.
Três artigos no arXiv tratam das limitações da destilação on-policy, em que um modelo professor supervisiona trajetórias geradas por um modelo aluno. O FutureBridge-OPD testa intervenções curtas do professor em estados de alta discordância e relata ganhos no ALFWorld, WebShop e ScienceWorld em uma configuração de Qwen3-32B para Qwen3-1.7B. O SPOT usa sondagem esparsa e continuações avaliadas por verificadores para decidir onde e o que destilar, enquanto um método de recuperabilidade contrafactual reproduz estados de erro para decidir se deve manter, reverter ou supervisionar uma trajetória de forma convencional.
⚡ Experimente hoje
Antes de adotar destilação on-policy para agentes, avalie as intervenções do professor pelo sucesso da continuação na tarefa final, não apenas pela divergência em nível de tokens.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Google avança em IA privada com criptografia homomórfica
O Google afirma estar tornando a IA privada mais prática com o uso de criptografia homomórfica.
Google diz que está tornando a IA privada viável
Uma publicação do Google Security gerou discussão no Hacker News em meio a críticas mais amplas à IA.
Pesquisadores lançam LittleLearner para estudo controlado de LLMs
O modelo de 5 bilhões de parâmetros foi treinado em um corpus curricular de 88 bilhões de tokens com conteúdo até o 5º ano.