AAI News Hub
InvestigaciónMon, August 3, 2026·Aug 3

LongHorizon-Harness apunta al estado de agentes de largo horizonte

El banco de investigación separa el estado de la tarea de la ejecución y verifica las actualizaciones mediante un ciclo de auditoría.

Por qué importa

El trabajo aborda un modo de fallo central en los agentes de ejecución prolongada: errores acumulativos derivados de autoevaluaciones obsoletas o incorrectas. Una gestión explícita del estado, verificada de forma independiente, podría hacer que los sistemas de agentes sean más fiables en flujos de trabajo intensivos en herramientas.

Puntos clave

  • 1.LongHorizon-Harness almacena el estado de la tarea fuera del contexto de ejecución.
  • 2.El ciclo MEA verifica las actualizaciones antes de la siguiente subtarea.
  • 3.Las mejoras reportadas en benchmarks incluyen Qwen 3.7-Plus en WeaveBench.

Investigadores propusieron LongHorizon-Harness, un marco para agentes LLM de largo horizonte que gestiona el estado de la tarea fuera del contexto creciente del modelo. Su ciclo Manage-Execute-Audit usa un gestor para elegir subtareas, un ejecutor con contexto nuevo para actuar y un auditor de solo lectura para verificar el estado del entorno antes de actualizar el registro de la tarea. El artículo informa mejoras de Qwen 3.7-Plus en WeaveBench, Terminal-Bench 2.1 y OSWorld 2.0.

Pruébalo hoy

Al crear agentes de largo horizonte, separa el estado de la tarea del contexto de ejecución y verifica los cambios de estado frente al entorno antes de continuar.

Fuentes y cobertura original

Este resumen sintetiza y enlaza la cobertura de los medios siguientes.

¿Te gustó este resumen? Recibe el próximo en tu correo.

Más en Investigación