AAI News Hub
InvestigaciónTue, August 4, 2026·Aug 42 sources corroborating

Investigadores apuntan a los fallos de destilación on-policy en agentes

Artículos recientes en arXiv proponen ajustes de entrenamiento sensibles al turno, al paso y al prefijo para agentes LLM que usan herramientas.

Por qué importa

El trabajo refleja un giro más amplio desde el aprendizaje por refuerzo basado solo en resultados hacia una supervisión más densa y consciente del estado para entrenar agentes. Esto importa porque los agentes que usan herramientas suelen fallar a lo largo de múltiples turnos, donde las recompensas generales de trayectoria pueden no identificar qué paso o llamada a herramienta causó el fallo.

Puntos clave

  • 1.Los nuevos métodos reponderan la destilación según la calidad del turno, el paso, el prefijo o la muestra.
  • 2.Los artículos apuntan a recompensas escasas y señales de profesor poco fiables en trayectorias largas de agentes.
  • 3.Los errores en llamadas a herramientas pueden propagarse en cadena y debilitar la supervisión del profesor a nivel de token.

Un conjunto de artículos recientes en arXiv propone nuevas formas de entrenar agentes de modelos de lenguaje integrados con herramientas y de varios turnos mediante destilación on-policy y aprendizaje por refuerzo. Los métodos incluyen TurnSight, SOD, ATOD, PG-OPD y RSTG, y todos abordan problemas de fiabilidad como recompensas escasas, errores en cadena en llamadas a herramientas, divergencia profesor-estudiante, rollouts largos ineficientes y gradientes perdidos en grupos de recompensa de varianza cero. Los artículos reportan experimentos en razonamiento de largo horizonte, matemáticas, ciencia, código y tareas interactivas de agentes, pero los resúmenes proporcionados no establecen un único líder de referencia entre todos los métodos.

Pruébalo hoy

Si entrenas agentes que usan herramientas, revisa si la supervisión del profesor está condicionada por la calidad del paso o del turno antes de combinar OPD con RL.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación