AAI News Hub
InvestigaciónThu, August 6, 2026·Aug 62 sources corroborating

Investigadores perfeccionan la destilación on-policy para agentes

Tres artículos en arXiv proponen formas de comprobar cuándo la guía de un docente mejora las trayectorias del estudiante.

Por qué importa

El trabajo apunta a un enfoque más selectivo para destilar comportamientos agénticos y de razonamiento, en el que el desacuerdo local entre modelos no se trata como prueba suficiente para intervenir. Eso podría ser importante para crear modelos más pequeños que conserven el rendimiento en tareas posteriores sin copiar todas las preferencias del docente.

Puntos clave

  • 1.FutureBridge-OPD reporta mejoras en ALFWorld, WebShop y ScienceWorld.
  • 2.SPOT asigna sondeos limitados usando entropía, masa top-k y desajuste entre docente y estudiante.
  • 3.Las etiquetas de recuperabilidad distinguen errores corregibles de estados que requieren reversión.

Tres artículos en arXiv abordan los límites de la destilación on-policy, en la que un modelo docente supervisa trayectorias generadas por un modelo estudiante. FutureBridge-OPD prueba breves intervenciones del docente en estados con alto desacuerdo y reporta mejoras en ALFWorld, WebShop y ScienceWorld en un esquema de Qwen3-32B a Qwen3-1.7B. SPOT utiliza sondeos escasos y continuaciones puntuadas por un verificador para decidir dónde y qué destilar, mientras que un método de recuperabilidad contrafactual reproduce estados de error para decidir si conservar, revertir o supervisar de forma convencional una trayectoria.

Pruébalo hoy

Antes de adoptar la destilación on-policy para agentes, evalúa las intervenciones del docente por el éxito de la continuación en la tarea, no solo por la divergencia a nivel de tokens.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación