ClawGym II mira RL black-box para harnesses de agentes
O artigo propõe rollouts em sandbox e recuperação de trajetórias para treinar agentes por meio de harnesses complexos.
Por que importa
Harnesses de agentes são cada vez mais importantes para tarefas de longo horizonte, mas treinar modelos por meio de harnesses opacos e de várias etapas continua difícil. O trabalho oferece infraestrutura e métodos de otimização voltados a tornar o aprendizado por reforço mais escalável e consistente para sistemas de agentes.
Pontos-chave
- 1.A execução em sandbox isola rollouts de harnesses em escala.
- 2.O proxy de serving captura chamadas ao modelo sem expor os detalhes internos do harness.
- 3.Árvores de prefixos reconstroem trajetórias multi-turno para PPO e GRPO.
O artigo ClawGym II apresenta um framework unificado de aprendizado por reforço black-box para otimizar agentes gerais por meio de harnesses de agentes complexos. A abordagem usa execução baseada em sandbox para rollouts concorrentes em larga escala, um proxy de serving na fronteira do modelo para capturar chamadas ao modelo e árvores de prefixos para reconstruir trajetórias multi-turno. Os autores adaptam tanto PPO quanto GRPO para otimizar sobre a estrutura de árvore recuperada e introduzem treinamento mix-harness para harnesses heterogêneos.
⚡ Experimente hoje
Leia o artigo antes de projetar loops de treinamento de RL para agentes que rodam por meio de harnesses opacos ou heterogêneos.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores apresentam o TTP-D para roteirização com caminhões e drones
O novo benchmark combina seleção de itens, rotas dependentes da carga e sincronização de drones.
Estudo mostra que contexto de auditoria e correção torna verificadores baseados em LLMs mais lenientes
O artigo no arXiv relata menos falsos alarmes após episódios anteriores de auditoria e correção no contexto do modelo.
AlphaEvolve ajuda a reduzir o limite da multiplicação de matrizes
Uma nova nota no arXiv relata um limite superior melhorado para o expoente da multiplicação de matrizes.