ClawGym II apunta al RL de caja negra para arneses de agentes
El artículo propone rollouts en entornos aislados y recuperación de trayectorias para entrenar agentes mediante arneses complejos.
Por qué importa
Los arneses de agentes son cada vez más importantes para tareas de largo horizonte, pero entrenar modelos a través de arneses opacos y de múltiples pasos sigue siendo difícil. Este trabajo ofrece infraestructura y métodos de optimización orientados a hacer que el aprendizaje por refuerzo sea más escalable y consistente para los sistemas de agentes.
Puntos clave
- 1.La ejecución en sandbox aísla rollouts de arneses a escala.
- 2.El proxy de servicio captura llamadas al modelo sin exponer los detalles internos del arnés.
- 3.Los árboles de prefijos reconstruyen trayectorias de varios turnos para PPO y GRPO.
El artículo de ClawGym II presenta un marco unificado de aprendizaje por refuerzo de caja negra para optimizar agentes generales a través de arneses de agentes complejos. El enfoque utiliza ejecución basada en sandboxes para rollouts concurrentes a gran escala, un proxy de servicio en el límite del modelo para capturar llamadas al modelo y árboles de prefijos para reconstruir trayectorias de varios turnos. Los autores adaptan tanto PPO como GRPO para optimizar sobre la estructura de árbol recuperada e introducen entrenamiento mix-harness para arneses heterogéneos.
⚡ Pruébalo hoy
Lee el artículo antes de diseñar bucles de entrenamiento RL para agentes que funcionan a través de arneses opacos o heterogéneos.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AILEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 19, 12:00 PM↗
- arXiv cs.CLClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.AIClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.LGClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- HF Daily PapersClawGym II: Exploring Black-Box RL on Agent HarnessAug 17, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
HarnessRisk evalúa fallos de seguridad en arneses de agentes
El benchmark prueba ataques en distintas fases de los arneses de agentes, mientras trabajos relacionados estudian el aprovisionamiento específico por tarea.
Agent Lightning v1.0 apunta al RL agéntico con harness
El framework conecta harnesses de agentes arbitrarios con el post-entrenamiento mediante aprendizaje por refuerzo.
IBM prueba cuánta memoria necesitan los agentes de IA
Un estudio de ALTK-Evolve concluye que las mejoras por memoria en agentes dependen de la capacidad del modelo y de la estrategia de entrega.