AAI News Hub
InvestigaciónWed, August 5, 2026·6d ago2 sources corroborating

Investigadores amplían la destilación on-policy entre modelos de IA

Nuevos artículos apuntan a los límites multimodales, agénticos y de generación de imágenes en el entrenamiento OPD.

Por qué importa

El trabajo sugiere que OPD se está convirtiendo en un patrón de entrenamiento más amplio, más allá de la imitación de modelos de lenguaje, pero los investigadores están comprobando que una supervisión ingenua del profesor puede desorientar a los estudiantes cuando divergen las modalidades, las arquitecturas o las trayectorias. Un mejor filtrado, enrutamiento y calendarios híbridos de RL podrían ser importantes para modelos multimodales compactos, generadores de imágenes y agentes pequeños.

Puntos clave

  • 1.Las variantes de OPD se orientan al entrenamiento de modelos multimodales, agénticos y de correspondencia de flujo.
  • 2.Los nuevos métodos filtran señales engañosas del profesor o las enrutan por modalidad.
  • 3.Varios artículos se centran en profesores heterogéneos con arquitecturas incompatibles.

Varios artículos de investigación nuevos y actualizados proponen variantes de la destilación on-policy, un método de posentrenamiento que usa señales de un modelo profesor sobre trayectorias generadas por el modelo estudiante. Los trabajos abordan distintos modos de fallo: profesores multimodales con señales contradictorias, supervisión espuria a nivel de token, familias incompatibles de modelos de generación de imágenes, modelos de flujo con múltiples profesores, cascadas de llamadas a herramientas en agentes pequeños y entrenamiento de agentes multiturno de largo horizonte. Entre los métodos propuestos figuran OPOD, SA-OPD, Any-OPD, Poly-OPD, SOD y ATOD.

Pruébalo hoy

Antes de usar OPD, evalúa si las señales del profesor siguen estando fundamentadas y son fiables en las trayectorias generadas por el propio estudiante.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación