AAI News Hub
InvestigaciónWed, August 19, 2026·1d ago2 sources corroborating

Investigadores proponen marcos de RL para harnesses de agentes

LEGO-RL y ClawGym II buscan un aprendizaje por refuerzo estable para agentes de IA de horizonte largo.

Por qué importa

El trabajo aborda un problema central en el entrenamiento de agentes de IA: los harnesses mejoran el desempeño en tareas de horizonte largo, pero sus fallos, su ejecución opaca y los desajustes entre entrenamiento e inferencia pueden corromper las señales de RL. Un RL nativo de harness más fiable podría hacer que la optimización de agentes esté mejor alineada con el comportamiento en despliegues reales.

Puntos clave

  • 1.LEGO-RL apunta al entrenamiento de harnesses para agentes de programación.
  • 2.ClawGym II propone RL de caja negra para agentes generales.
  • 3.Ambos usan proxies y sandboxes para estabilizar los rollouts.

Dos nuevos papers en arXiv describen marcos para aplicar aprendizaje por refuerzo a agentes que se ejecutan dentro de harnesses complejos y de larga duración. LEGO-RL se centra en agentes de programación, con proxying de LLM en proceso, orquestación de sandboxes, herramientas de validación y monitoreo, y una interfaz en vivo para alinear el entrenamiento con gradiente de política con la ejecución nativa del harness. ClawGym II presenta un marco de RL de caja negra para agentes generales, que utiliza rollouts concurrentes en sandbox, proxies de servicio en los límites del modelo, reconstrucción de trayectorias con árboles de prefijos y adaptaciones de PPO y GRPO.

Pruébalo hoy

Lee ambos papers antes de construir pipelines de RL en torno a harnesses de agentes de programación o de agentes generales.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación