De nouveaux articles ciblent les limites de l’exploration des LLM
DORA, 3PO et RISE-RL proposent des pistes pour améliorer l’exploration dans les agents et l’entraînement RL.
Pourquoi c'est important
Ces articles mettent en évidence une limite commune des méthodes d’exploration au niveau des tokens, comme l’ajustement de la température : elles ne produisent pas forcément une diversité utile au niveau de la séquence. Une meilleure exploration pourrait améliorer les agents LLM, l’entraînement au raisonnement et les workflows d’alignement ouverts sans dépendre uniquement de changements de prompts ou de récompenses scalaires.
Points clés
- 1.DORA améliore l’exploration au niveau de la séquence sans entraînement.
- 2.3PO échantillonne des politiques pour diversifier les rollouts RLVR.
- 3.RISE-RL cible les critères de grille d’évaluation manqués à plusieurs reprises.
Plusieurs articles publiés sur arXiv décrivent de nouvelles méthodes pour améliorer l’exploration dans les grands modèles de langage. DORA Explorer est un algorithme sans entraînement, utilisé au moment de l’inférence, qui génère plusieurs actions candidates, les évalue à l’aide de statistiques de log-probabilité au niveau de la séquence, puis échantillonne avec un paramètre d’exploration ajustable. 3PO explore l’espace des paramètres pour le RLVR en échantillonnant différentes politiques à partir d’une distribution a posteriori, tandis que RISE-RL s’appuie sur des critères de grille d’évaluation manqués à plusieurs reprises pour guider une exploration sélective dans le RL ouvert.
⚡ À tester aujourd'hui
Lisez les articles sur DORA et 3PO avant de vous fier uniquement à la température pour l’exploration des agents ou les rollouts RL.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AIDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLDORA Explorer: Improving the Exploration Ability of LLMs Without TrainingAug 13, 12:00 PM↗
- arXiv cs.CLParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- arXiv cs.AIRISE-RL: Rubric-Informed Selective Exploration for Open-Ended Reinforcement LearningAug 11, 12:00 PM↗
- arXiv cs.LGParameter Exploration for RLVR via Variational LearningAug 11, 12:00 PM↗
- HF Daily PapersParameter Exploration for RLVR via Variational LearningAug 10, 8:28 PM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Une étude montre que le contexte d’audit-réparation rend les vérificateurs LLM plus indulgents
L’article publié sur arXiv fait état de moins de fausses alertes après des épisodes antérieurs d’audit-réparation dans le contexte du modèle.
AlphaEvolve contribue à abaisser la borne de la multiplication matricielle
Une nouvelle note publiée sur arXiv fait état d’une borne supérieure améliorée pour l’exposant de la multiplication matricielle.
InternLM propose l’architecture de modèle Mobius
L’article publié sur arXiv sépare mémoire et raisonnement afin d’améliorer la compression et l’efficacité de l’inférence.