AAI News Hub
PesquisaMon, August 17, 2026·1d ago2 sources corroborating

ClawGym II mira RL black-box para harnesses de agentes

O artigo propõe rollouts em sandbox e recuperação de trajetórias para treinar agentes por meio de harnesses complexos.

Por que importa

Harnesses de agentes são cada vez mais importantes para tarefas de longo horizonte, mas treinar modelos por meio de harnesses opacos e de várias etapas continua difícil. O trabalho oferece infraestrutura e métodos de otimização voltados a tornar o aprendizado por reforço mais escalável e consistente para sistemas de agentes.

Pontos-chave

  • 1.A execução em sandbox isola rollouts de harnesses em escala.
  • 2.O proxy de serving captura chamadas ao modelo sem expor os detalhes internos do harness.
  • 3.Árvores de prefixos reconstroem trajetórias multi-turno para PPO e GRPO.

O artigo ClawGym II apresenta um framework unificado de aprendizado por reforço black-box para otimizar agentes gerais por meio de harnesses de agentes complexos. A abordagem usa execução baseada em sandbox para rollouts concorrentes em larga escala, um proxy de serving na fronteira do modelo para capturar chamadas ao modelo e árvores de prefixos para reconstruir trajetórias multi-turno. Os autores adaptam tanto PPO quanto GRPO para otimizar sobre a estrutura de árvore recuperada e introduzem treinamento mix-harness para harnesses heterogêneos.

Experimente hoje

Leia o artigo antes de projetar loops de treinamento de RL para agentes que rodam por meio de harnesses opacos ou heterogêneos.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa