AAI News Hub
ForschungTue, August 4, 2026·Aug 42 sources corroborating

OneDayAgent testet autonome Agenten-Workflows über lange Zeiträume

Das Harness steuert Aufgabenzerlegung, Gedächtnis und Verifikation über 104 Benchmark-Aufgaben hinweg.

Warum es wichtig ist

Die Arbeit adressiert hartnäckige Fehlermuster in agentischen Systemen, darunter Zielabweichung, Zustandsverlust und Kontextüberlauf. Die berichtete Leistung über fünf Backend-LLMs aus drei Modellfamilien hinweg deutet darauf hin, dass Harness-Design die Zuverlässigkeit über lange Zeithorizonte unabhängig von einem einzelnen Modell verbessern kann.

Die Kernpunkte

  • 1.OneDayAgent steuert Zerlegung, Gedächtnis und finale Verifikation.
  • 2.Mit GLM-5.2 erzielte es 0,821 auf 104 AgentIF-OneDay-Aufgaben.
  • 3.Das Harness lief mit fünf LLM-Backends aus drei Modellfamilien.

Forscher haben OneDayAgent vorgestellt, ein Harness für autonome Agenten, die offene Alltagsanfragen aus Arbeit, Studium und Privatleben bearbeiten. Das System zerlegt Anfragen in begrenzte Teilaufgaben, bewahrt Ausführungsgedächtnis unter Kontextdruck und überprüft sowie repariert finale Ergebnisse. Auf AgentIF-OneDay wurde es über 104 Aufgaben evaluiert und erreichte mit dem GLM-5.2-Backend eine Gesamtbewertung von 0,821.

Heute ausprobieren

Lesen Sie das Paper, bevor Sie Long-Horizon-Agenten entwerfen, die Ziele, Gedächtnis und Ergebnisqualität über viele Schritte hinweg bewahren müssen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung