AAI News Hub
ForschungFri, August 21, 2026·3h ago2 sources corroborating

AI4AI-Bench testet Agenten beim Entwurf von Trainingsalgorithmen

Der arXiv-Benchmark prüft, ob LLM-Agenten Trainingsalgorithmen in eingefrorenen Repositories umschreiben können.

Warum es wichtig ist

Die Arbeit adressiert eine Lücke in der Bewertung von Agenten, indem sie Änderungen an der Ausführung von Trainingsläufen von Änderungen daran trennt, wie Modelle lernen. Zugleich macht sie ein ungelöstes Terminologieproblem sichtbar: ob dauerhafte Verbesserungen des Forschungsstands als rekursive Selbstverbesserung gelten sollten, wenn es keine Fähigkeitsgewinne auf Gewichtsebene gibt.

Die Kernpunkte

  • 1.Der Benchmark umfasst 10 eingefrorene Repositories und Familien von Trainingsalgorithmen.
  • 2.Agenten erhalten 4 Stunden zum Umschreiben von Algorithmen und werden anschließend versteckt evaluiert.
  • 3.Das Setup zeigt keine Selbstverbesserung auf Ebene der Modellgewichte.

Ein neues arXiv-Paper stellt AI4AI-Bench vor, einen Benchmark, der testet, ob LLM-Agenten bessere Trainingsalgorithmen entwerfen können. Die Autoren beschreiben diese Fähigkeit als zentral für rekursive Selbstverbesserung. Der Benchmark umfasst 10 eingefrorene Forschungs-Repositories aus 10 Familien von Trainingsalgorithmen. In jeder Aufgabe erhält ein Agent 4 Stunden auf einer B300, um den Trainingsalgorithmus umzuschreiben; anschließend wird sein Code von Grund auf bis zu 12 Stunden erneut ausgeführt und von einem versteckten, festen Evaluator gegen den ursprünglichen Algorithmus bewertet. Eine Diskussion auf Reddit weist darauf hin, dass das Setup eine engere Definition rekursiver Selbstverbesserung verwendet, weil das zugrunde liegende Modell und der Evaluator unverändert bleiben, statt dass das Modell seine eigenen Gewichte verändert.

Heute ausprobieren

Lesen Sie das AI4AI-Bench-Paper, bevor Sie seine Ergebnisse als Beleg für rekursive Selbstverbesserung auf Gewichtsebene verwenden.

Quellen & Originalberichte

Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.

Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.

Mehr in Forschung