AAI News Hub
RechercheTue, August 4, 2026·Aug 42 sources corroborating

CALVER remet en question le vote pour le raisonnement causal des LLM

Le vérificateur symbolique a surpassé la sélection de type self-consistency sur des tâches de raisonnement causal à réponses multiples.

Pourquoi c'est important

Ces travaux suggèrent que le vote fondé sur la fréquence des réponses constitue une règle de sélection fragile pour les tâches de raisonnement causal comportant plusieurs sorties valides. Ils orientent plutôt vers une vérification spécifique au domaine, plutôt que vers de simples juges plus grands, pour améliorer la fiabilité.

Points clés

  • 1.CALVER évalue les traces à l’aune de critères causaux de type Pearl.
  • 2.Le vote peut favoriser des erreurs de confusion répétées au détriment de traces minoritaires valides.
  • 3.Un juge de 72B n’a pas comblé l’écart rapporté.

Un nouvel article publié sur arXiv présente CALVER, un vérificateur symbolique sans entraînement conçu pour choisir entre plusieurs traces de raisonnement causal produites par des LLM. Selon les auteurs, la self-consistency peut échouer lorsque de nombreuses réponses sont valides, car des erreurs de confusion répétées et des réponses valides fragmentées peuvent permettre à une réponse invalide de l’emporter. Sur les requêtes CLEAR de type find-one-valid, CALVER a atteint 42,1 %, tandis que le vote à la pluralité, un modèle de récompense, un juge LLM et la confiance du modèle sont restés proches de 30 % sur les mêmes ensembles figés.

À tester aujourd'hui

Pour les workflows de raisonnement causal, évaluez la vérification symbolique ou fondée sur des règles avant de vous appuyer sur le vote par self-consistency.

Sources et articles originaux

Ce brief résume et renvoie vers la couverture des médias ci-dessous.

Ce brief vous a plu ? Recevez le prochain par e-mail.

Plus dans Recherche