AAI News Hub
ForschungTue, August 4, 2026·Aug 42 sources corroborating

PAST-Bench prüft, ob persönliche Agenten mit der Zeit besser werden

Der Benchmark misst Fortschritte durch gespeicherte Erfahrungen über Modelle, Frameworks und Agentenaufgaben hinweg.

Warum es wichtig ist

Die Arbeit gibt Agentenentwicklern eine gezieltere Möglichkeit, Behauptungen über langfristiges Lernen zu bewerten, indem sie Leistungsgewinne von Belegen dafür trennt, dass Speicher- und Aktualisierungsmechanismen diese tatsächlich verursacht haben.

Die Kernpunkte

  • 1.PAST-Bench umfasst 26 Szenarien und 204 Episoden.
  • 2.Die Tests vergleichen Läufe mit gespeicherter Erfahrung mit passenden Kontrollläufen.
  • 3.Die berichteten Zugewinne variieren je nach Fähigkeit und kausalem Pfad.

Forschende haben PAST-Bench vorgestellt, einen Benchmark, der testet, ob persönliche KI-Agenten gespeicherte Erfahrungen in besseres künftiges Verhalten umsetzen. Der Benchmark vergleicht Aufgabenfolgen in neuen Sitzungen mit aktivierter oder deaktivierter Erfahrungsspeicherung über 26 Szenarien und 204 Episoden hinweg. Über sieben Basismodelle und vier Agenten-Frameworks hinweg berichten die Autoren von realen, aber uneinheitlichen Verbesserungen; ähnliche Gesamtergebnisse unterschieden sich teils darin, ob sie tatsächlich dem vorgesehenen Pfad aus Speichern, Abrufen und Aktualisieren folgten.

Heute ausprobieren

Nutzen Sie Ablationen im Stil von PAST-Bench, bevor Sie behaupten, ein persönlicher Agent verbessere sich durch gespeicherte Erfahrungen.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung