AAI News Hub
PesquisaFri, August 7, 2026·6d ago2 sources corroborating

EnvACE e State2State miram treinamento escalável de agentes com LLMs

Dois artigos no arXiv propõem formas de reduzir a dependência de tarefas, verificadores e ambientes executáveis construídos manualmente.

Por que importa

Os artigos abordam um gargalo central no desenvolvimento de agentes: escalar o treinamento de uso de ferramentas em horizontes longos sem ambientes executáveis caros, verificadores feitos à mão ou demonstrações de especialistas. Se forem validadas além dos benchmarks relatados, essas abordagens podem tornar o treinamento de agentes mais transferível e menos dependente de engenharia de ambientes sob medida.

Pontos-chave

  • 1.O EnvACE treina agentes por meio de ensaio de mundo autogerado.
  • 2.O State2State deriva objetivos de agentes a partir de estados de ambiente explorados.
  • 3.Ambos os métodos buscam reduzir a supervisão manual no treinamento de agentes.

Dois novos artigos no arXiv propõem métodos de treinamento para agentes com LLMs que reduzem a dependência de supervisão especificada externamente. O EnvACE substitui a interação com ambientes externos durante o treinamento por “ensaio de mundo”, em que a política gera chamadas de ferramentas, simula a resposta do ambiente e otimiza os dois papéis com recompensas de sucesso na tarefa. O State2State converte estados de ambiente explorados em objetivos de estado-alvo, usando correspondência de estados baseada em regras em vez de trajetórias de especialistas ou desenho manual de tarefas, e relata ganhos no ALFWorld e no ScienceWorld.

Experimente hoje

Leia os artigos EnvACE e State2State antes de projetar novos pipelines de treinamento de agentes com LLMs que dependam de ambientes feitos à mão ou trajetórias de especialistas.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa