AAI News Hub
ForschungWed, August 5, 2026·Aug 52 sources corroborating

GDPevo-Benchmark testet Selbstentwicklung von Agenten

Der Benchmark nutzt Aufgaben aus Unternehmensworkflows, um zu messen, ob Agenten aus früheren Erfahrungen besser werden.

Warum es wichtig ist

Die Arbeit zielt auf eine zentrale Evaluierungslücke bei AI-Agenten: ob Leistungszuwächse auf wiederverwendbare Erfahrung zurückgeführt werden können statt auf Kontamination oder Benchmark-Artefakte. Die automatisierte Pipeline soll die Testsuite erweitern und das Kontaminationsrisiko verringern.

Die Kernpunkte

  • 1.Testet Leistungszuwächse von Agenten durch frühere Erfahrung
  • 2.Deckt CRM, ERP, Finanzen, Gesundheitswesen und Rechts-Workflows ab
  • 3.V1 umfasst 120 Aufgaben in 12 Gruppen

Forschende haben GDPevo vorgestellt, einen Benchmark zur Bewertung der Selbstentwicklung von Agenten in BIP-bezogenen Unternehmensworkflows. Der Benchmark nutzt regelbasierte Hybridisierung, um Workflows in atomare Geschäftsregeln zu zerlegen, sie auf Trainingsaufgaben zu verteilen und in zurückgehaltenen Testaufgaben neu zu kombinieren. GDPevo deckt CRM, ERP, Finanzen, Gesundheitswesen, Recht und datenorientierte Workflows ab; Version V1 umfasst 120 Aufgaben in 12 Gruppen.

Heute ausprobieren

Prüfen Sie GDPevo, bevor Sie behaupten, ein Agent verbessere sich durch persistentes Gedächtnis oder Erfahrung aus früheren Aufgaben.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung