AI4AI-Bench testet Agenten beim Entwurf von Trainingsalgorithmen
Der arXiv-Benchmark prüft, ob LLM-Agenten Trainingsalgorithmen in eingefrorenen Repositories umschreiben können.
Warum es wichtig ist
Die Arbeit adressiert eine Lücke in der Bewertung von Agenten, indem sie Änderungen an der Ausführung von Trainingsläufen von Änderungen daran trennt, wie Modelle lernen. Zugleich macht sie ein ungelöstes Terminologieproblem sichtbar: ob dauerhafte Verbesserungen des Forschungsstands als rekursive Selbstverbesserung gelten sollten, wenn es keine Fähigkeitsgewinne auf Gewichtsebene gibt.
Die Kernpunkte
- 1.Der Benchmark umfasst 10 eingefrorene Repositories und Familien von Trainingsalgorithmen.
- 2.Agenten erhalten 4 Stunden zum Umschreiben von Algorithmen und werden anschließend versteckt evaluiert.
- 3.Das Setup zeigt keine Selbstverbesserung auf Ebene der Modellgewichte.
Ein neues arXiv-Paper stellt AI4AI-Bench vor, einen Benchmark, der testet, ob LLM-Agenten bessere Trainingsalgorithmen entwerfen können. Die Autoren beschreiben diese Fähigkeit als zentral für rekursive Selbstverbesserung. Der Benchmark umfasst 10 eingefrorene Forschungs-Repositories aus 10 Familien von Trainingsalgorithmen. In jeder Aufgabe erhält ein Agent 4 Stunden auf einer B300, um den Trainingsalgorithmus umzuschreiben; anschließend wird sein Code von Grund auf bis zu 12 Stunden erneut ausgeführt und von einem versteckten, festen Evaluator gegen den ursprünglichen Algorithmus bewertet. Eine Diskussion auf Reddit weist darauf hin, dass das Setup eine engere Definition rekursiver Selbstverbesserung verwendet, weil das zugrunde liegende Modell und der Evaluator unverändert bleiben, statt dass das Modell seine eigenen Gewichte verändert.
⚡ Heute ausprobieren
Lesen Sie das AI4AI-Bench-Paper, bevor Sie seine Ergebnisse als Beleg für rekursive Selbstverbesserung auf Gewichtsebene verwenden.
Quellen & Originalberichte
Dieser Brief fasst die Berichterstattung der folgenden Medien zusammen und verlinkt sie.
- arXiv cs.LGAI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-ImprovementAug 21, 12:00 PM↗
- arXiv cs.CLAI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-ImprovementAug 21, 12:00 PM↗
- r/LocalLLaMAIf the weights never change, is it really recursive self-improvement?Aug 18, 10:10 PM↗
Hat dir dieses Briefing gefallen? Erhalte das nächste per Mail.
Mehr in Forschung
MemTrapBench testet kognitive Fallen beim Speichereinsatz von LLMs
Der Benchmark zeigt, dass Speicher die Aufgabenleistung verschlechtern kann, selbst wenn die abgerufenen Einträge relevant sind.
Neue Arbeiten zielen auf Sparse Attention für Long-Context-KI
Forschende schlagen Methoden für günstigere Long-Context-Inferenz, Serving, Videogenerierung und Speicher vor.
SWE-bench Science testet Coding-Agenten an wissenschaftlichem Code
Der Benchmark umfasst 119 Aufgaben aus 98 GitHub-Repositories in 20 wissenschaftlichen Fachgebieten.