AAI News Hub
ForschungMon, August 3, 2026·Aug 3

LongHorizon-Harness zielt auf den Zustand von Long-Horizon-Agenten

Das Forschungs-Harness trennt den Aufgabenstatus von der Ausführung und überprüft Aktualisierungen in einer Audit-Schleife.

Warum es wichtig ist

Die Arbeit adressiert einen zentralen Fehlermodus bei lang laufenden Agenten: sich verstärkende Fehler durch veraltete oder falsche Selbsteinschätzungen. Explizites, unabhängig verifiziertes Zustandsmanagement könnte Agentensysteme in tool-intensiven Workflows zuverlässiger machen.

Die Kernpunkte

  • 1.LongHorizon-Harness speichert den Aufgabenstatus außerhalb des Ausführungskontexts.
  • 2.Die MEA-Schleife verifiziert Aktualisierungen vor der nächsten Teilaufgabe.
  • 3.Zu den berichteten Benchmark-Verbesserungen zählt Qwen 3.7-Plus auf WeaveBench.

Forschende haben LongHorizon-Harness vorgestellt, ein Framework für Long-Horizon-LLM-Agenten, das den Aufgabenstatus außerhalb des wachsenden Kontexts des Modells verwaltet. Seine Manage-Execute-Audit-Schleife nutzt einen Manager zur Auswahl von Teilaufgaben, einen Executor mit frischem Kontext für die Ausführung und einen schreibgeschützten Auditor, der den Zustand der Umgebung prüft, bevor der Aufgabendatensatz aktualisiert wird. Das Paper berichtet über Verbesserungen für Qwen 3.7-Plus auf WeaveBench, Terminal-Bench 2.1 und OSWorld 2.0.

Heute ausprobieren

Beim Aufbau von Long-Horizon-Agenten sollte der Aufgabenstatus vom Ausführungskontext getrennt und Zustandsänderungen vor dem Fortfahren gegen die Umgebung verifiziert werden.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung