CALVER、LLMの因果推論における投票方式に一石
この記号的検証器は、複数解があり得る因果推論タスクで、自己一貫性型の選択手法を上回った。
なぜ重要か
この研究は、複数の有効な出力があり得る因果推論タスクでは、回答頻度に基づく投票が弱い選択ルールであることを示唆している。信頼性を高める手段として、大型のジャッジだけに頼るのではなく、領域特化型の検証が有望であることを示している。
要点
- 1.CALVERは、Pearl流の因果基準に照らしてトレースを採点する。
- 2.投票では、有効だが少数派のトレースより、繰り返される交絡エラーが選ばれやすい。
- 3.72Bのジャッジでも、報告された差は埋まらなかった。
新たなarXiv論文が、LLMの因果推論トレースから解を選ぶための、学習不要の記号的検証器「CALVER」を紹介した。著者らによると、有効な答えが多数存在する場合、自己一貫性は失敗し得る。交絡に関する誤りが繰り返され、有効な答えが分散することで、無効な答えが勝ってしまうためだ。CLEARのfind-one-validクエリでは、同じ固定プール上で複数決、報酬モデル、LLMジャッジ、モデル信頼度がいずれも30%前後にとどまる一方、CALVERは42.1%に達した。
⚡ 今日から使える
因果推論ワークフローでは、自己一貫性投票に頼る前に、記号的またはルールベースの検証を評価すべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AICan Post-Training Transform LLMs into Causal Reasoners?Aug 6, 12:00 PM↗
- arXiv cs.LGCan Post-Training Transform LLMs into Causal Reasoners?Aug 6, 12:00 PM↗
- arXiv cs.AIWhen Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMsAug 5, 12:00 PM↗
- arXiv cs.CLLanguage Models Encode the Contextual Truth of PropositionsAug 5, 12:00 PM↗
- HF Daily PapersWhen Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMsAug 4, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
Google、準同型暗号でプライベートAIを前進
Googleは、準同型暗号を活用してプライベートAIをより実用的にしようとしていると説明している。
Hacker News+8 outlets·14h ago
研究
Google、プライベートAIの実用化を進めていると説明
Google Securityの投稿がHacker Newsで議論を呼び、AI全般への批判とも並んだ。
Hacker News+5 outlets·14h ago
研究
研究者ら、LLMを制御下で研究するためのLittleLearnerを公開
50億パラメータのモデルは、小学5年生以下のカリキュラムに基づく880億トークンのコーパスで訓練された。
r/LocalLLaMA+1 outlet·19h ago