LongHorizon-Harness apunta al estado de agentes de largo horizonte
El banco de investigación separa el estado de la tarea de la ejecución y verifica las actualizaciones mediante un ciclo de auditoría.
Por qué importa
El trabajo aborda un modo de fallo central en los agentes de ejecución prolongada: errores acumulativos derivados de autoevaluaciones obsoletas o incorrectas. Una gestión explícita del estado, verificada de forma independiente, podría hacer que los sistemas de agentes sean más fiables en flujos de trabajo intensivos en herramientas.
Puntos clave
- 1.LongHorizon-Harness almacena el estado de la tarea fuera del contexto de ejecución.
- 2.El ciclo MEA verifica las actualizaciones antes de la siguiente subtarea.
- 3.Las mejoras reportadas en benchmarks incluyen Qwen 3.7-Plus en WeaveBench.
Investigadores propusieron LongHorizon-Harness, un marco para agentes LLM de largo horizonte que gestiona el estado de la tarea fuera del contexto creciente del modelo. Su ciclo Manage-Execute-Audit usa un gestor para elegir subtareas, un ejecutor con contexto nuevo para actuar y un auditor de solo lectura para verificar el estado del entorno antes de actualizar el registro de la tarea. El artículo informa mejoras de Qwen 3.7-Plus en WeaveBench, Terminal-Bench 2.1 y OSWorld 2.0.
⚡ Pruébalo hoy
Al crear agentes de largo horizonte, separa el estado de la tarea del contexto de ejecución y verifica los cambios de estado frente al entorno antes de continuar.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
InternLM propone la arquitectura de modelo Mobius
El artículo en arXiv separa la memoria y el razonamiento para mejorar la compresión y la eficiencia de inferencia.
Las herramientas y prácticas de IA para desarrolladores generan debate en Hacker News
Publicaciones sobre MathCode, hábitos de programación con IA, Cloudflare y HEIR de Google impulsaron la discusión.
Google avanza en la IA privada con cifrado homomórfico
Google afirma que está haciendo más práctica la IA privada mediante el cifrado homomórfico.