Pesquisadores propõem frameworks de RL para harnesses de agentes
LEGO-RL e ClawGym II miram aprendizado por reforço estável para agentes de IA em tarefas de longo horizonte.
Por que importa
O trabalho aborda um problema central no treinamento de agentes de IA: harnesses melhoram o desempenho em tarefas de longo horizonte, mas suas falhas, sua execução opaca e os desalinhamentos entre treino e inferência podem corromper os sinais de RL. Um RL nativo a harnesses mais confiável poderia tornar a otimização de agentes mais alinhada ao comportamento em implantação real.
Pontos-chave
- 1.O LEGO-RL mira o treinamento de harnesses para agentes de programação.
- 2.O ClawGym II propõe RL de caixa-preta para agentes gerais.
- 3.Ambos usam proxies e sandboxes para estabilizar rollouts.
Dois novos artigos no arXiv descrevem frameworks para aplicar aprendizado por reforço a agentes que rodam dentro de harnesses complexos e de longa duração. O LEGO-RL se concentra em agentes de programação, usando proxying de LLM em processo, orquestração de sandboxes, ferramentas de validação e monitoramento e uma interface ao vivo para alinhar o treinamento por gradiente de política à execução nativa no harness. O ClawGym II apresenta um framework de RL de caixa-preta para agentes gerais, usando rollouts concorrentes em sandbox, proxies de serving nas fronteiras do modelo, reconstrução de trajetórias por árvore de prefixos e adaptações de PPO e GRPO.
⚡ Experimente hoje
Leia os dois artigos antes de criar pipelines de RL em torno de harnesses para agentes de programação ou agentes gerais.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AILEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 19, 12:00 PM↗
- arXiv cs.CLClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.AIClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- arXiv cs.LGClawGym II: Exploring Black-Box RL on Agent HarnessAug 18, 12:00 PM↗
- HF Daily PapersLEGO-RL: Harness-Native Reinforcement Learning for Coding AgentsAug 18, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Startup diz que dados são essenciais para avanços da IA contra o câncer
Segundo o TechCrunch, a startup afirma que a IA ainda não está perto de curar o câncer sem dados melhores.
HarnessRisk mede falhas de segurança em harnesses de agentes
O benchmark testa ataques em diferentes fases de harnesses de agentes, enquanto trabalhos relacionados analisam provisionamento específico por tarefa.
Agent Lightning v1.0 mira RL agêntico com harness
O framework conecta harnesses arbitrários de agentes ao pós-treinamento por aprendizado por reforço.