Pesquisadores propõem novos métodos de destilação on-policy
Vários artigos no arXiv investigam quando e como a orientação de um modelo professor deve moldar modelos alunos menores.
Por que importa
O trabalho aponta para uma limitação comum na destilação: sinais mais fortes do professor nem sempre são úteis se o aluno não consegue representá-los ou se eles prejudicam trajetórias posteriores. Isso importa para tornar modelos e agentes menores mais confiáveis sem simplesmente copiar professores em escala de fronteira.
Pontos-chave
- 1.A orientação do professor pode falhar quando os alunos não conseguem representar a correção.
- 2.Verificações de trajetórias futuras superaram a OPD vanilla em benchmarks de agentes.
- 3.Rótulos de recuperabilidade podem orientar se estados divergentes devem ser mantidos ou revertidos.
Um conjunto de artigos no arXiv propõe refinamentos para a destilação on-policy, uma abordagem de treinamento que supervisiona modelos alunos com base em trajetórias que eles próprios geram. Os métodos incluem Fisher-Projected OPD para modelos de visão-linguagem, FutureBridge-OPD para tarefas de agentes em múltiplos turnos, SPOT para sondagem esparsa e alvos calibrados por resultado, além de controle sensível à recuperabilidade para decidir se estados de raciocínio divergentes devem ser mantidos, revertidos ou supervisionados normalmente. As avaliações relatadas abrangem raciocínio em visão-linguagem, ALFWorld, WebShop, ScienceWorld, AIME e GPQA-Diamond, com vários artigos afirmando ganhos em relação a linhas de base de OPD vanilla.
⚡ Experimente hoje
Antes de aplicar OPD, teste se as intervenções do professor melhoram as continuações posteriores do aluno, não apenas a concordância local de tokens.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.LGDistill What the Student Can See: Fisher-Projected On-Policy Distillation for Vision-Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AISPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AINot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGLook Ahead Before You Distill: Future Trajectory Validation of Teacher Guidance for Agentic On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGSPOT: Sparse Probing and Outcome Calibration for On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.LGNot Every Divergence Should Be Suppressed: Counterfactual Recoverability in On-Policy DistillationAug 6, 12:00 PM↗
- arXiv cs.AIWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.AIOPOD: On-Policy Omni DistillationAug 5, 12:00 PM↗
- arXiv cs.CLOPTD: On-Policy Transition Distillation with Consistency-Guided Adaptive Compression for Few-Step Diffusion Language ModelsAug 5, 12:00 PM↗
- arXiv cs.LGWhen Context Returns: Toward Robust Internalization in On-Policy DistillationAug 5, 12:00 PM↗
- arXiv cs.LGAny-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space BridgingAug 5, 12:00 PM↗
- HF Daily PapersPoly-OPD: Heterogeneous Multi-Teacher On-Policy Distillation for Capability-Selectable Flow ModelsAug 5, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.