CALVER 挑战 LLM 因果推理中的投票机制
这款符号验证器在多答案因果任务上击败了多数投票、奖励模型和 LLM 评审。
为什么重要
这些结果表明,当有效答案很多时,自一致性可能失效,因为反复出现的混杂错误和分散的有效票数,可能让无效答案胜出。相比单纯依靠更大的评审模型,符号验证或许能成为因果推理工作流中更强的选择层。
核心要点
- 1.CALVER 使用因果公理而非参考答案来选择候选项。
- 2.它在多答案 CLEAR 查询上达到 42.1%。
- 3.将 LLM 评审扩展到 72B 仍未缩小差距。
一篇新论文介绍了 CALVER,这是一种无需训练的符号验证器,用于在因果推理任务中从抽样得到的 LLM 推理轨迹中做选择。该方法依据 Pearl 风格的因果标准为结构化轨迹评分,包括 d-分离、后门调整和干预,而不是依赖出现频率最高的答案。在 CLEAR 的 find-one-valid 查询中,当存在多个有效答案时,CALVER 达到 42.1%;而在同一批冻结候选池上,多数投票、奖励模型、LLM 评审和模型置信度都徘徊在 30% 左右。
⚡ 今天就能用
应审查使用自一致性的因果推理流水线,并在依赖多数投票答案之前测试符号检查。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AICan Post-Training Transform LLMs into Causal Reasoners?Aug 6, 12:00 PM↗
- arXiv cs.LGCan Post-Training Transform LLMs into Causal Reasoners?Aug 6, 12:00 PM↗
- arXiv cs.AIWhen Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMsAug 5, 12:00 PM↗
- arXiv cs.CLLanguage Models Encode the Contextual Truth of PropositionsAug 5, 12:00 PM↗
- HF Daily PapersWhen Many Answers Are Valid, Voting Fails: Symbolic Verification for Best-of-K Causal Reasoning in LLMsAug 4, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。