EnvACE e State2State miram treinamento escalável de agentes com LLMs
Dois artigos no arXiv propõem formas de reduzir a dependência de tarefas, verificadores e ambientes executáveis construídos manualmente.
Por que importa
Os artigos abordam um gargalo central no desenvolvimento de agentes: escalar o treinamento de uso de ferramentas em horizontes longos sem ambientes executáveis caros, verificadores feitos à mão ou demonstrações de especialistas. Se forem validadas além dos benchmarks relatados, essas abordagens podem tornar o treinamento de agentes mais transferível e menos dependente de engenharia de ambientes sob medida.
Pontos-chave
- 1.O EnvACE treina agentes por meio de ensaio de mundo autogerado.
- 2.O State2State deriva objetivos de agentes a partir de estados de ambiente explorados.
- 3.Ambos os métodos buscam reduzir a supervisão manual no treinamento de agentes.
Dois novos artigos no arXiv propõem métodos de treinamento para agentes com LLMs que reduzem a dependência de supervisão especificada externamente. O EnvACE substitui a interação com ambientes externos durante o treinamento por “ensaio de mundo”, em que a política gera chamadas de ferramentas, simula a resposta do ambiente e otimiza os dois papéis com recompensas de sucesso na tarefa. O State2State converte estados de ambiente explorados em objetivos de estado-alvo, usando correspondência de estados baseada em regras em vez de trajetórias de especialistas ou desenho manual de tarefas, e relata ganhos no ALFWorld e no ScienceWorld.
⚡ Experimente hoje
Leia os artigos EnvACE e State2State antes de projetar novos pipelines de treinamento de agentes com LLMs que dependam de ambientes feitos à mão ou trajetórias de especialistas.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AIEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- arXiv cs.LGState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- HF Daily PapersEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 6, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Estudo da Anthropic mostra que agentes de IA podem entrar em conflito em tarefas compartilhadas
Pesquisadores dizem que o comportamento multiagente pode expor lacunas nos testes atuais de segurança em IA.
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.