AAI News Hub
PesquisaWed, August 19, 2026·1d ago2 sources corroborating

Pesquisadores propõem frameworks de RL para harnesses de agentes

LEGO-RL e ClawGym II miram aprendizado por reforço estável para agentes de IA em tarefas de longo horizonte.

Por que importa

O trabalho aborda um problema central no treinamento de agentes de IA: harnesses melhoram o desempenho em tarefas de longo horizonte, mas suas falhas, sua execução opaca e os desalinhamentos entre treino e inferência podem corromper os sinais de RL. Um RL nativo a harnesses mais confiável poderia tornar a otimização de agentes mais alinhada ao comportamento em implantação real.

Pontos-chave

  • 1.O LEGO-RL mira o treinamento de harnesses para agentes de programação.
  • 2.O ClawGym II propõe RL de caixa-preta para agentes gerais.
  • 3.Ambos usam proxies e sandboxes para estabilizar rollouts.

Dois novos artigos no arXiv descrevem frameworks para aplicar aprendizado por reforço a agentes que rodam dentro de harnesses complexos e de longa duração. O LEGO-RL se concentra em agentes de programação, usando proxying de LLM em processo, orquestração de sandboxes, ferramentas de validação e monitoramento e uma interface ao vivo para alinhar o treinamento por gradiente de política à execução nativa no harness. O ClawGym II apresenta um framework de RL de caixa-preta para agentes gerais, usando rollouts concorrentes em sandbox, proxies de serving nas fronteiras do modelo, reconstrução de trajetórias por árvore de prefixos e adaptações de PPO e GRPO.

Experimente hoje

Leia os dois artigos antes de criar pipelines de RL em torno de harnesses para agentes de programação ou agentes gerais.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa