MLLM推論におけるモダリティバランスに注目する論文
2つの新手法は、モデルが画像とテキストの信号をどう使うかを制御し、視覚推論の改善を狙う。
なぜ重要か
両報告は、MLLMの中心的な課題に焦点を当てている。つまり、テキスト生成が支配的になったり、不確実性指標が知覚と論理を切り分けられなかったりすると、視覚推論が劣化し得るという問題だ。今回の研究は、より大きなモデルだけに頼らず、マルチモーダル推論を改善するための、より的を絞った推論手法や事後学習手法の方向性を示している。
要点
- 1.AGSは学習なしで潜在推論と明示的推論を切り替える。
- 2.OPD-Vはモダリティバランスを使って視覚的自己蒸留を導く。
- 3.両手法はいずれも、マルチモーダル推論におけるテキスト支配の問題に取り組んでいる。
研究者らは、マルチモーダル大規模言語モデル向けの学習不要の推論戦略「Attention-Guided Switching」を説明した。これは、視覚からテキストへの注意比率を使い、知覚トークンには潜在推論を、論理的なステップには明示的推論を使うタイミングを判断する。別のHF Daily Papersの項目では、OPD-Vという視覚的オンポリシー自己蒸留手法が紹介された。これはモダリティバランスを特権情報として扱い、モダリティバランスの信頼領域を通じてオンポリシートークンを選択する。OPD-Vの報告によると実験は6つのベンチマークに及ぶが、提示された出典抜粋には結果は含まれていない。
⚡ 今日から使える
視覚推論パイプラインにchain-of-thoughtや自己蒸留を加える前に、AGSとOPD-Vの論文を読むべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
- arXiv cs.AICorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.AIDASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning ModelsAug 7, 12:00 PM↗
- arXiv cs.LGOn-Policy Self-Distillation without Any SupervisionAug 7, 12:00 PM↗
- arXiv cs.CLCorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLRP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning TransferAug 7, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- HF Daily PapersOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 5, 4:00 AM↗
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
Anthropicの研究、AIエージェントが共同タスクで衝突し得ると指摘
研究者らは、マルチエージェントの振る舞いが現行のAI安全性テストの盲点を浮き彫りにする可能性があるとしている。
研究者ら、映像の反射除去に向けた拡散モデルを提案
S2Rは、物理ベースの反射シミュレーションと、拡散型の映像除去モデルおよびベンチマークを組み合わせる。
論文、エージェント安全性には実行時契約が必要と主張
arXiv論文は、自律型エージェントには訓練時のアラインメントだけでは不十分だとしている。