AAI News Hub
InvestigaciónFri, August 7, 2026·5d ago2 sources corroborating

EnvACE y State2State apuntan al entrenamiento escalable de agentes con LLM

Dos artículos en arXiv proponen formas de reducir la dependencia de tareas, verificadores y entornos ejecutables creados a mano.

Por qué importa

Los artículos abordan un cuello de botella central en el desarrollo de agentes: escalar el entrenamiento de uso de herramientas a largo horizonte sin entornos ejecutables costosos, verificadores artesanales ni demostraciones expertas. Si se validan más allá de los benchmarks reportados, estos enfoques podrían hacer que el entrenamiento de agentes sea más transferible y menos dependiente de ingeniería de entornos a medida.

Puntos clave

  • 1.EnvACE entrena agentes mediante ensayo del mundo autogenerado.
  • 2.State2State deriva objetivos de agente a partir de estados de entorno explorados.
  • 3.Ambos métodos buscan reducir la supervisión manual en el entrenamiento de agentes.

Dos nuevos artículos en arXiv proponen métodos de entrenamiento para agentes con LLM que reducen la dependencia de supervisión especificada externamente. EnvACE sustituye la interacción con entornos externos durante el entrenamiento por “ensayo del mundo”, en el que la política genera llamadas a herramientas, simula la respuesta del entorno y optimiza ambos roles con recompensas por éxito en la tarea. State2State convierte estados de entorno explorados en objetivos de estado meta, usando correspondencia de estados basada en reglas en lugar de trayectorias expertas o diseño manual de tareas, y reporta mejoras en ALFWorld y ScienceWorld.

Pruébalo hoy

Lee los artículos de EnvACE y State2State antes de diseñar nuevos pipelines de entrenamiento para agentes con LLM que dependan de entornos artesanales o trayectorias expertas.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación