AAI News Hub
InvestigaciónFri, August 7, 2026·5d ago2 sources corroborating

Investigadores proponen nuevos métodos de destilación on-policy

Varios artículos en arXiv analizan cuándo y cómo la guía del modelo docente debe moldear modelos estudiantes más pequeños.

Por qué importa

El trabajo apunta a una limitación común de la destilación: las señales de docentes más fuertes no siempre son útiles si el estudiante no puede representarlas o si perjudican trayectorias posteriores. Esto importa para hacer que modelos y agentes más pequeños sean más fiables sin copiar a ciegas a docentes de escala frontera.

Puntos clave

  • 1.La guía del docente puede fallar cuando los estudiantes no pueden representar la corrección.
  • 2.Las comprobaciones de trayectorias futuras superaron a la OPD vanilla en benchmarks de agentes.
  • 3.Las etiquetas de recuperabilidad pueden orientar si conviene conservar o revertir estados divergentes.

Un conjunto de artículos en arXiv propone mejoras a la destilación on-policy, un enfoque de entrenamiento que supervisa a los modelos estudiantes a partir de trayectorias que ellos mismos generan. Los métodos incluyen Fisher-Projected OPD para modelos de visión-lenguaje, FutureBridge-OPD para tareas de agentes de múltiples turnos, SPOT para sondeo disperso y objetivos calibrados por resultados, y control consciente de la recuperabilidad para decidir si los estados de razonamiento divergentes deben conservarse, revertirse o supervisarse de forma normal. Las evaluaciones reportadas abarcan razonamiento de visión-lenguaje, ALFWorld, WebShop, ScienceWorld, AIME y GPQA-Diamond, y varios artículos afirman obtener mejoras frente a las líneas base de OPD vanilla.

Pruébalo hoy

Antes de aplicar OPD, hay que comprobar si las intervenciones del docente mejoran las continuaciones posteriores del estudiante, no solo la concordancia local de tokens.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación