AAI News Hub
RechercheWed, August 5, 2026·Aug 52 sources corroborating

Des chercheurs proposent Skill Entropy pour évaluer le raisonnement des LLM

Skill^2-Bench teste la capacité des modèles à passer d’une compétence à l’autre dans des tâches de longue haleine.

Pourquoi c'est important

Ces travaux ciblent une lacune dans l’évaluation du raisonnement de longue haleine : déterminer si les modèles peuvent combiner de manière fiable différentes compétences dans des chaînes dépendantes. Ils suggèrent que le passage d’une compétence à l’autre reste une faiblesse mesurable, même pour les modèles actuels les plus performants.

Points clés

  • 1.Skill Entropy mesure la difficulté à passer d’une compétence de raisonnement à une autre.
  • 2.Skill^2-Bench couvre 558 compétences dans neuf domaines.
  • 3.Les modèles évalués ont perdu en précision sur les tâches à entropie plus élevée.

Un nouvel article présente Skill Entropy, une mesure destinée à évaluer la difficulté de passer d’une compétence de raisonnement à une autre dans des tâches LLM en plusieurs étapes. Les auteurs proposent aussi Skill^2-Bench, un benchmark couvrant 558 compétences dans neuf domaines vérifiables et ouverts, et indiquent que huit modèles de pointe et quatre modèles open source perdent en précision sur les tâches à entropie plus élevée. L’article propose également Skill-Entropy RL, qui utilise l’entropie des compétences comme signal d’entraînement.

À tester aujourd'hui

Utilisez Skill^2-Bench pour mettre à l’épreuve des agents ou systèmes de raisonnement qui doivent combiner plusieurs compétences au fil d’étapes dépendantes.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche