Pesquisadores levam a destilação on-policy além dos professores tradicionais
Novos artigos no arXiv miram limites da OPD em geradores, agentes, VLMs e LLMs.
Por que importa
Os trabalhos indicam que a OPD está se tornando um conjunto de ferramentas mais amplo para transferir comportamento quando modelos professor e aluno diferem em arquitetura, modalidade, capacidade ou dinâmica de trajetória. Isso pode ser relevante para implantar modelos menores ou especializados sem exigir um professor maior e estreitamente compatível.
Pontos-chave
- 1.Any-OPD conecta geradores de flow matching incompatíveis por meio de representações visuais.
- 2.FutureBridge-OPD testa a orientação do professor em relação a trajetórias posteriores de agentes.
- 3.Variantes weak-to-strong e projetadas por Fisher miram incompatibilidades de capacidade.
Vários novos artigos no arXiv propõem formas de flexibilizar premissas centrais da destilação on-policy, em que um modelo aluno é treinado com estados ou amostras que ele próprio gera. O Any-OPD mira geradores de flow matching latente de diferentes famílias de modelos ao comparar saídas decodificadas de forma independente em uma representação visual congelada, enquanto o FutureBridge-OPD valida a orientação do professor testando seu efeito em trajetórias posteriores de agentes. Outros trabalhos propõem destilar alunos fortes a partir de pares de modelos mais fracos e projetar correções de professores de visão-linguagem para aquilo que um aluno compacto consegue representar localmente.
⚡ Experimente hoje
Antes de adotar OPD, verifique se professor e aluno compartilham latentes, cronogramas, capacidade e comportamento de trajetória; escolha um método projetado para essa incompatibilidade.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.AIWhen Teachers Mislead: Spurious-Signal-Aware On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- arXiv cs.AISOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.AIATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic TasksAug 4, 12:00 PM↗
- arXiv cs.LGWeak-to-Strong On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 4, 12:00 PM↗
- arXiv cs.CLSOD: Step-wise On-policy Distillation for Small Language Model AgentsAug 4, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 4, 12:00 PM↗
- arXiv cs.CLDistill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher GuidanceAug 4, 12:00 PM↗
- HF Daily PapersAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 4, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.