Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.
Pourquoi c'est important
Ces résultats suggèrent qu’un certain transfert de capacités peut se produire via un échafaudage au moment de l’inférence, et pas seulement par distillation lors de l’entraînement. Cela pourrait déplacer l’attention vers la conception de dispositifs, le routage et les protocoles d’évaluation pour le déploiement de modèles plus petits.
Points clés
- 1.Les dispositifs au moment du test ont amélioré les scores des modèles plus faibles, de 0,49 à 0,91.
- 2.Les gains provenaient surtout du code, du routage et de l’application d’un format de réponse strict.
- 3.L’étude a utilisé quatre benchmarks de théorie de l’esprit.
Un nouvel article examine si un modèle « bâtisseur » plus puissant peut améliorer un modèle plus faible au moment du test en construisant des dispositifs d’inférence, sans modifier les paramètres du modèle plus faible. Sur quatre benchmarks de théorie de l’esprit, les bâtisseurs ont utilisé 5 % des données comme jeu de validation pour affiner ces dispositifs, puis les ont évalués sur l’ensemble du jeu de test. L’approche a presque doublé la performance moyenne des modèles cibles, de 0,49 à 0,91, les gains étant principalement attribués à du code déterministe, à un routage propre à chaque benchmark et à un formatage strict des réponses.
⚡ À tester aujourd'hui
Avant d’affiner un modèle plus faible, testez si un modèle plus puissant peut concevoir un dispositif d’inférence adapté à la tâche.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.LGAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.LGTowards Understanding On-Policy Distillation through the Lens of Test-Time ScalingAug 13, 12:00 PM↗
- arXiv cs.CLAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 13, 12:00 PM↗
- arXiv cs.CLTowards Understanding On-Policy Distillation through the Lens of Test-Time ScalingAug 13, 12:00 PM↗
- HF Daily PapersAI4AI at Test-Time: Strong-to-Weak Capability Transfer via HarnessesAug 12, 4:00 AM↗
- arXiv cs.AIProxy OPD: On-Policy Distillation with Transferable Relative Proxy UpdateAug 11, 12:00 PM↗
- arXiv cs.AIWDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-TrainingAug 11, 12:00 PM↗
- arXiv cs.LGProxy OPD: On-Policy Distillation with Transferable Relative Proxy UpdateAug 11, 12:00 PM↗
- arXiv cs.LGWDL-OPD: Weak-Driven On-Policy Distillation via Mixture-Constrained Co-TrainingAug 11, 12:00 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Google fait progresser l’IA privée grâce au chiffrement homomorphe
Google affirme rendre l’IA privée plus concrètement utilisable grâce au chiffrement homomorphe.
Google affirme rendre l’IA privée praticable
Un billet de Google Security a suscité des discussions sur Hacker News, dans un contexte plus large de critiques de l’IA.
Des chercheurs publient LittleLearner pour étudier les LLM en environnement contrôlé
Ce modèle de 5 milliards de paramètres est entraîné sur LITTLECURRICULUM, un corpus pédagogique de 88 milliards de tokens limité au niveau CM2 ou inférieur.