AAI News Hub
RechercheThu, August 13, 2026·5d ago2 sources corroborating

De nouveaux articles ciblent les limites de l’exploration des LLM

DORA, 3PO et RISE-RL proposent des pistes pour améliorer l’exploration dans les agents et l’entraînement RL.

Pourquoi c'est important

Ces articles mettent en évidence une limite commune des méthodes d’exploration au niveau des tokens, comme l’ajustement de la température : elles ne produisent pas forcément une diversité utile au niveau de la séquence. Une meilleure exploration pourrait améliorer les agents LLM, l’entraînement au raisonnement et les workflows d’alignement ouverts sans dépendre uniquement de changements de prompts ou de récompenses scalaires.

Points clés

  • 1.DORA améliore l’exploration au niveau de la séquence sans entraînement.
  • 2.3PO échantillonne des politiques pour diversifier les rollouts RLVR.
  • 3.RISE-RL cible les critères de grille d’évaluation manqués à plusieurs reprises.

Plusieurs articles publiés sur arXiv décrivent de nouvelles méthodes pour améliorer l’exploration dans les grands modèles de langage. DORA Explorer est un algorithme sans entraînement, utilisé au moment de l’inférence, qui génère plusieurs actions candidates, les évalue à l’aide de statistiques de log-probabilité au niveau de la séquence, puis échantillonne avec un paramètre d’exploration ajustable. 3PO explore l’espace des paramètres pour le RLVR en échantillonnant différentes politiques à partir d’une distribution a posteriori, tandis que RISE-RL s’appuie sur des critères de grille d’évaluation manqués à plusieurs reprises pour guider une exploration sélective dans le RL ouvert.

À tester aujourd'hui

Lisez les articles sur DORA et 3PO avant de vous fier uniquement à la température pour l’exploration des agents ou les rollouts RL.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche