Pesquisadores ampliam a destilação on-policy entre modelos de IA
Novos artigos miram limites multimodais, agentivos e de geração de imagens no treinamento com OPD.
Por que importa
Os trabalhos sugerem que a OPD está se tornando um padrão de treinamento mais amplo, indo além da imitação de modelos de linguagem, mas pesquisadores estão descobrindo que a supervisão ingênua por professores pode induzir alunos ao erro quando modalidades, arquiteturas ou trajetórias divergem. Filtragem, roteamento e cronogramas híbridos de RL melhores podem ser importantes para modelos multimodais compactos, geradores de imagens e agentes pequenos.
Pontos-chave
- 1.Variantes de OPD miram o treinamento de modelos multimodais, agentivos e de flow matching.
- 2.Novos métodos filtram sinais enganosos dos professores ou os roteiam por modalidade.
- 3.Vários artigos se concentram em professores heterogêneos com arquiteturas incompatíveis.
Vários artigos de pesquisa novos e atualizados propõem variantes da destilação on-policy, um método de pós-treinamento que usa sinais de professores em trajetórias geradas pelo aluno. Os trabalhos abordam diferentes modos de falha: professores multimodais conflitantes, supervisão espúria em nível de token, famílias incompatíveis de modelos de geração de imagens, modelos de fluxo com múltiplos professores, cascatas de chamadas de ferramentas em agentes pequenos e treinamento agentivo multi-turno de horizonte longo. Entre os métodos propostos estão OPOD, SA-OPD, Any-OPD, Poly-OPD, SOD e ATOD.
⚡ Experimente hoje
Antes de usar OPD, avalie se os sinais dos professores continuam bem fundamentados e confiáveis nas trajetórias geradas pelo próprio aluno.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLWhen Top-K Misses the Decision: Tool-Call Drift in Multi-Teacher On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 4, 4:00 AM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
DistilVDR comprime a recuperação visual de documentos
O recuperador de 524 milhões de parâmetros usa destilação bilateral a partir de um professor visão-linguagem de 8B.
Google testa AMIE em consultas médicas por vídeo em tempo real
O sistema de pesquisa baseado no Gemini foi avaliado em consultas simuladas de telessaúde.
Modelo da Anthropic avança em trabalho sobre a hipótese de Riemann
Um modelo ainda não lançado da Anthropic fez avanços no problema matemático há muito tempo sem solução, segundo o TechCrunch.