CALVER remet en question le vote pour le raisonnement causal des LLM
Le vérificateur symbolique a surpassé la sélection de type self-consistency sur des tâches de raisonnement causal à réponses multiples.
Pourquoi c'est important
Ces travaux suggèrent que le vote fondé sur la fréquence des réponses constitue une règle de sélection fragile pour les tâches de raisonnement causal comportant plusieurs sorties valides. Ils orientent plutôt vers une vérification spécifique au domaine, plutôt que vers de simples juges plus grands, pour améliorer la fiabilité.
Points clés
- 1.CALVER évalue les traces à l’aune de critères causaux de type Pearl.
- 2.Le vote peut favoriser des erreurs de confusion répétées au détriment de traces minoritaires valides.
- 3.Un juge de 72B n’a pas comblé l’écart rapporté.
Un nouvel article publié sur arXiv présente CALVER, un vérificateur symbolique sans entraînement conçu pour choisir entre plusieurs traces de raisonnement causal produites par des LLM. Selon les auteurs, la self-consistency peut échouer lorsque de nombreuses réponses sont valides, car des erreurs de confusion répétées et des réponses valides fragmentées peuvent permettre à une réponse invalide de l’emporter. Sur les requêtes CLEAR de type find-one-valid, CALVER a atteint 42,1 %, tandis que le vote à la pluralité, un modèle de récompense, un juge LLM et la confiance du modèle sont restés proches de 30 % sur les mêmes ensembles figés.
⚡ À tester aujourd'hui
Pour les workflows de raisonnement causal, évaluez la vérification symbolique ou fondée sur des règles avant de vous appuyer sur le vote par self-consistency.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AICan Post-Training Transform LLMs into Causal Reasoners?Aug 6, 12:00 PM↗
- arXiv cs.LGCan Post-Training Transform LLMs into Causal Reasoners?Aug 6, 12:00 PM↗
- arXiv cs.AIWhen Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMsAug 5, 12:00 PM↗
- arXiv cs.CLLanguage Models Encode the Contextual Truth of PropositionsAug 5, 12:00 PM↗
- HF Daily PapersWhen Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMsAug 4, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Google fait progresser l’IA privée grâce au chiffrement homomorphe
Google affirme rendre l’IA privée plus concrètement utilisable grâce au chiffrement homomorphe.
Google affirme rendre l’IA privée praticable
Un billet de Google Security a suscité des discussions sur Hacker News, dans un contexte plus large de critiques de l’IA.
Des chercheurs publient LittleLearner pour étudier les LLM en environnement contrôlé
Ce modèle de 5 milliards de paramètres est entraîné sur LITTLECURRICULUM, un corpus pédagogique de 88 milliards de tokens limité au niveau CM2 ou inférieur.