论文聚焦 MLLM 推理中的模态平衡
两种新方法试图通过管理模型对图像与文本信号的使用方式,提升视觉推理能力。
为什么重要
两份报告都聚焦 MLLM 的一个核心问题:当文本生成占据主导,或不确定性指标无法区分感知与逻辑时,视觉推理能力可能下降。这些工作指向了更有针对性的推理和后训练方法,用于改进多模态推理,而不是只依赖更大的模型。
核心要点
- 1.AGS 可在无需训练的情况下,在潜在推理与显式推理之间切换。
- 2.OPD-V 使用模态平衡来指导视觉自蒸馏。
- 3.两种方法都在应对多模态推理中的文本主导问题。
研究人员介绍了 Attention-Guided Switching,这是一种面向多模态大语言模型的免训练推理策略,利用视觉到文本的注意力比例来判断何时对感知类 token 使用潜在推理、何时对逻辑步骤使用显式推理。另一篇 HF Daily Papers 条目介绍了 OPD-V,这是一种视觉 on-policy 自蒸馏方法,将模态平衡视为特权信息,并通过模态平衡信任域选择 on-policy token。OPD-V 报告称实验覆盖六个基准,但所提供的来源摘录未包含结果。
⚡ 今天就能用
在把 chain-of-thought 或自蒸馏加入视觉推理流程之前,先阅读 AGS 和 OPD-V 论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AICorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.AIDASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning ModelsAug 7, 12:00 PM↗
- arXiv cs.LGOn-Policy Self-Distillation without Any SupervisionAug 7, 12:00 PM↗
- arXiv cs.CLCorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLRP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning TransferAug 7, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- HF Daily PapersOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 5, 4:00 AM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。