AI4AI-Bench teste les agents sur la conception d’algorithmes d’entraînement
Ce benchmark publié sur arXiv évalue si des agents LLM peuvent réécrire des algorithmes d’entraînement dans des dépôts figés.
Pourquoi c'est important
Ce travail vise une lacune dans l’évaluation des agents en distinguant les changements dans l’exécution des entraînements de ceux qui concernent la manière dont les modèles apprennent. Il met aussi en lumière une question terminologique non résolue : des améliorations persistantes de l’état de la recherche doivent-elles compter comme de l’auto-amélioration récursive en l’absence de gains de capacité au niveau des poids ?
Points clés
- 1.Le benchmark couvre 10 dépôts figés et familles d’algorithmes d’entraînement.
- 2.Les agents disposent de 4 heures pour réécrire les algorithmes, puis sont soumis à une évaluation cachée.
- 3.Le dispositif ne montre pas d’auto-amélioration au niveau des poids du modèle.
Un nouvel article publié sur arXiv présente AI4AI-Bench, un benchmark destiné à tester si des agents LLM peuvent concevoir de meilleurs algorithmes d’entraînement, une capacité que les auteurs présentent comme centrale pour l’auto-amélioration récursive. Le benchmark couvre 10 dépôts de recherche figés répartis entre 10 familles d’algorithmes d’entraînement ; pour chaque tâche, un agent dispose de 4 heures sur un B300 pour réécrire l’algorithme d’entraînement, après quoi son code est relancé de zéro pendant jusqu’à 12 heures et noté par un évaluateur fixe et caché par rapport à l’algorithme d’origine. Une discussion sur Reddit relève que le dispositif emploie une définition plus étroite de l’auto-amélioration récursive, car le modèle sous-jacent et l’évaluateur restent fixes, au lieu que le modèle modifie ses propres poids.
⚡ À tester aujourd'hui
Lisez l’article sur AI4AI-Bench avant d’utiliser ses résultats comme preuve d’une auto-amélioration récursive au niveau des poids.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.LGAI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-ImprovementAug 21, 12:00 PM↗
- arXiv cs.CLAI4AI-Bench: Benchmarking LLM Agents in Algorithmic Design for Recursive Self-ImprovementAug 21, 12:00 PM↗
- r/LocalLLaMAIf the weights never change, is it really recursive self-improvement?Aug 18, 10:10 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
MemTrapBench teste les pièges cognitifs liés à l’usage de la mémoire par les LLM
Le benchmark montre que la mémoire peut dégrader les performances, même lorsque les éléments retrouvés sont pertinents.
De nouveaux articles ciblent l’attention éparse pour l’IA à long contexte
Des chercheurs proposent des méthodes pour rendre moins coûteuses l’inférence à long contexte, le serving, la génération vidéo et la mémoire.
SWE-bench Science met les agents de code à l’épreuve sur du code scientifique
Le benchmark comprend 119 tâches issues de 98 dépôts GitHub, couvrant 20 domaines scientifiques.