EnvACE y State2State apuntan al entrenamiento escalable de agentes con LLM
Dos artículos en arXiv proponen formas de reducir la dependencia de tareas, verificadores y entornos ejecutables creados a mano.
Por qué importa
Los artículos abordan un cuello de botella central en el desarrollo de agentes: escalar el entrenamiento de uso de herramientas a largo horizonte sin entornos ejecutables costosos, verificadores artesanales ni demostraciones expertas. Si se validan más allá de los benchmarks reportados, estos enfoques podrían hacer que el entrenamiento de agentes sea más transferible y menos dependiente de ingeniería de entornos a medida.
Puntos clave
- 1.EnvACE entrena agentes mediante ensayo del mundo autogenerado.
- 2.State2State deriva objetivos de agente a partir de estados de entorno explorados.
- 3.Ambos métodos buscan reducir la supervisión manual en el entrenamiento de agentes.
Dos nuevos artículos en arXiv proponen métodos de entrenamiento para agentes con LLM que reducen la dependencia de supervisión especificada externamente. EnvACE sustituye la interacción con entornos externos durante el entrenamiento por “ensayo del mundo”, en el que la política genera llamadas a herramientas, simula la respuesta del entorno y optimiza ambos roles con recompensas por éxito en la tarea. State2State convierte estados de entorno explorados en objetivos de estado meta, usando correspondencia de estados basada en reglas en lugar de trayectorias expertas o diseño manual de tareas, y reporta mejoras en ALFWorld y ScienceWorld.
⚡ Pruébalo hoy
Lee los artículos de EnvACE y State2State antes de diseñar nuevos pipelines de entrenamiento para agentes con LLM que dependan de entornos artesanales o trayectorias expertas.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AIEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 7, 12:00 PM↗
- arXiv cs.CLState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- arXiv cs.LGState2State: Environment-Derived Mid-Training for LLM AgentsAug 6, 12:00 PM↗
- HF Daily PapersEnvACE: Internalizing Environment Dynamics via World Rehearsal for Agentic Reinforcement LearningAug 6, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
El equipo de MiLMMT lanza modelos de traducción sin referencias
MiLMMT-46-v1.0 usa GRPO e interpolación de checkpoints para mejorar la traducción multilingüe abierta.
DistilVDR comprime la recuperación de documentos visuales
El recuperador de 524 millones de parámetros usa destilación bilateral a partir de un modelo docente de visión-lenguaje de 8B.
Investigadores proponen Power Law Graph Attention
PLGA generaliza la atención de producto punto escalado y reporta colapso de inferencia bajo invariancia exacta.