Investigadores proponen marcos de RL para harnesses de agentes
LEGO-RL y ClawGym II buscan un aprendizaje por refuerzo estable para agentes de IA de horizonte largo.
Por qué importa
El trabajo aborda un problema central en el entrenamiento de agentes de IA: los harnesses mejoran el desempeño en tareas de horizonte largo, pero sus fallos, su ejecución opaca y los desajustes entre entrenamiento e inferencia pueden corromper las señales de RL. Un RL nativo de harness más fiable podría hacer que la optimización de agentes esté mejor alineada con el comportamiento en despliegues reales.
Puntos clave
- 1.LEGO-RL apunta al entrenamiento de harnesses para agentes de programación.
- 2.ClawGym II propone RL de caja negra para agentes generales.
- 3.Ambos usan proxies y sandboxes para estabilizar los rollouts.
Dos nuevos papers en arXiv describen marcos para aplicar aprendizaje por refuerzo a agentes que se ejecutan dentro de harnesses complejos y de larga duración. LEGO-RL se centra en agentes de programación, con proxying de LLM en proceso, orquestación de sandboxes, herramientas de validación y monitoreo, y una interfaz en vivo para alinear el entrenamiento con gradiente de política con la ejecución nativa del harness. ClawGym II presenta un marco de RL de caja negra para agentes generales, que utiliza rollouts concurrentes en sandbox, proxies de servicio en los límites del modelo, reconstrucción de trayectorias con árboles de prefijos y adaptaciones de PPO y GRPO.
⚡ Pruébalo hoy
Lee ambos papers antes de construir pipelines de RL en torno a harnesses de agentes de programación o de agentes generales.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AILEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 19, 12:00 PM↗
- arXiv cs.CLClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.AIClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.LGClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- HF Daily PapersLEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 18, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Una startup afirma que los datos son clave para avanzar contra el cáncer con IA
TechCrunch informa que la startup sostiene que la IA no está cerca de curar el cáncer sin mejores datos.
HarnessRisk evalúa fallos de seguridad en arneses de agentes
El benchmark prueba ataques en distintas fases de los arneses de agentes, mientras trabajos relacionados estudian el aprovisionamiento específico por tarea.
Agent Lightning v1.0 apunta al RL agéntico con harness
El framework conecta harnesses de agentes arbitrarios con el post-entrenamiento mediante aprendizaje por refuerzo.