Des chercheurs publient LittleLearner pour étudier les LLM en environnement contrôlé
Ce modèle de 5 milliards de paramètres est entraîné sur LITTLECURRICULUM, un corpus pédagogique de 88 milliards de tokens limité au niveau CM2 ou inférieur.
Pourquoi c'est important
Ces travaux offrent un cadre contrôlé pour examiner si les comportements des LLM proviennent de connaissances apprises ou d’une sollicitation ultérieure. Leurs résultats suggèrent que les limites des données de préentraînement peuvent imposer un plafond réel aux capacités, que le seul post-entraînement ne suffit pas forcément à dépasser.
Points clés
- 1.LITTLECURRICULUM contient 88 milliards de tokens de contenus de niveau Grade 5 ou inférieur.
- 2.LITTLELEARNER est un modèle de 5 milliards de paramètres entraîné à partir de zéro.
- 3.Le post-entraînement et le prompting ont amélioré l’utilisation des connaissances existantes, pas les capacités hors périmètre.
Des chercheurs ont présenté LITTLECURRICULUM, un corpus de préentraînement de 88 milliards de tokens conçu à partir de contenus de l’école élémentaire aux États-Unis, en excluant les notions, faits et vocabulaire au-delà du Grade 5. Ils ont entraîné à partir de zéro un modèle de langage de 5 milliards de paramètres, LITTLELEARNER, sur ce corpus, et ont publié les deux comme environnement de test pour étudier l’acquisition de connaissances par les modèles dans un périmètre d’entraînement défini. Les premières expériences montrent que le passage à l’échelle, le post-entraînement avec SFT et GRPO, ainsi que l’apprentissage en contexte aident le modèle à exploiter ses connaissances existantes, mais n’améliorent pas sensiblement ses capacités hors périmètre.
⚡ À tester aujourd'hui
Utiliser LITTLECURRICULUM et LITTLELEARNER pour tester des méthodes d’injection de connaissances avant de supposer que le post-entraînement peut ajouter des capacités hors périmètre.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
HarnessRisk évalue les défaillances de sécurité dans les harnais d’agents
Le benchmark teste des attaques à différentes phases des harnais d’agents, tandis que des travaux connexes étudient le provisionnement propre à chaque tâche.
Agent Lightning v1.0 cible le RL agentique avec harnais
Le framework relie des harnais d’agents arbitraires au post-entraînement par apprentissage par renforcement.
Une étude teste le transfert de mémoire entre modèles pour les LLM
Des chercheurs examinent comment une mémoire apprise figée peut passer d’une architecture de modèle à une autre grâce à un lecteur côté cible.