AAI News Hub
InvestigaciónMon, August 17, 2026·2d ago2 sources corroborating

ClawGym II apunta al RL de caja negra para arneses de agentes

El artículo propone rollouts en entornos aislados y recuperación de trayectorias para entrenar agentes mediante arneses complejos.

Por qué importa

Los arneses de agentes son cada vez más importantes para tareas de largo horizonte, pero entrenar modelos a través de arneses opacos y de múltiples pasos sigue siendo difícil. Este trabajo ofrece infraestructura y métodos de optimización orientados a hacer que el aprendizaje por refuerzo sea más escalable y consistente para los sistemas de agentes.

Puntos clave

  • 1.La ejecución en sandbox aísla rollouts de arneses a escala.
  • 2.El proxy de servicio captura llamadas al modelo sin exponer los detalles internos del arnés.
  • 3.Los árboles de prefijos reconstruyen trayectorias de varios turnos para PPO y GRPO.

El artículo de ClawGym II presenta un marco unificado de aprendizaje por refuerzo de caja negra para optimizar agentes generales a través de arneses de agentes complejos. El enfoque utiliza ejecución basada en sandboxes para rollouts concurrentes a gran escala, un proxy de servicio en el límite del modelo para capturar llamadas al modelo y árboles de prefijos para reconstruir trayectorias de varios turnos. Los autores adaptan tanto PPO como GRPO para optimizar sobre la estructura de árbol recuperada e introducen entrenamiento mix-harness para arneses heterogéneos.

Pruébalo hoy

Lee el artículo antes de diseñar bucles de entrenamiento RL para agentes que funcionan a través de arneses opacos o heterogéneos.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación