LongHorizon-Harness zielt auf den Zustand von Long-Horizon-Agenten
Das Forschungs-Harness trennt den Aufgabenstatus von der Ausführung und überprüft Aktualisierungen in einer Audit-Schleife.
Warum es wichtig ist
Die Arbeit adressiert einen zentralen Fehlermodus bei lang laufenden Agenten: sich verstärkende Fehler durch veraltete oder falsche Selbsteinschätzungen. Explizites, unabhängig verifiziertes Zustandsmanagement könnte Agentensysteme in tool-intensiven Workflows zuverlässiger machen.
Die Kernpunkte
- 1.LongHorizon-Harness speichert den Aufgabenstatus außerhalb des Ausführungskontexts.
- 2.Die MEA-Schleife verifiziert Aktualisierungen vor der nächsten Teilaufgabe.
- 3.Zu den berichteten Benchmark-Verbesserungen zählt Qwen 3.7-Plus auf WeaveBench.
Forschende haben LongHorizon-Harness vorgestellt, ein Framework für Long-Horizon-LLM-Agenten, das den Aufgabenstatus außerhalb des wachsenden Kontexts des Modells verwaltet. Seine Manage-Execute-Audit-Schleife nutzt einen Manager zur Auswahl von Teilaufgaben, einen Executor mit frischem Kontext für die Ausführung und einen schreibgeschützten Auditor, der den Zustand der Umgebung prüft, bevor der Aufgabendatensatz aktualisiert wird. Das Paper berichtet über Verbesserungen für Qwen 3.7-Plus auf WeaveBench, Terminal-Bench 2.1 und OSWorld 2.0.
⚡ Heute ausprobieren
Beim Aufbau von Long-Horizon-Agenten sollte der Aufgabenstatus vom Ausführungskontext getrennt und Zustandsänderungen vor dem Fortfahren gegen die Umgebung verifiziert werden.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
Forschende stellen TTP-D für die Routenplanung mit Lkw und Drohnen vor
Der neue Benchmark kombiniert Artikelauswahl, lastabhängige Routenführung und Drohnensynchronisierung.
Studie: Audit-Reparatur-Kontext macht LLM-Prüfer nachsichtiger
Das arXiv-Paper berichtet von weniger Fehlalarmen, wenn zuvor Audit-Reparatur-Episoden im Modellkontext standen.
AlphaEvolve senkt Schranke für Matrixmultiplikation
Eine neue arXiv-Notiz meldet eine verbesserte obere Schranke für den Exponenten der Matrixmultiplikation.