Des articles ciblent l’équilibre des modalités dans le raisonnement des MLLM
Deux nouvelles méthodes visent à améliorer le raisonnement visuel en gérant la façon dont les modèles exploitent les signaux issus de l’image et du texte.
Pourquoi c'est important
Les deux rapports s’attaquent à un problème central des MLLM : le raisonnement visuel peut se dégrader lorsque la génération de texte domine ou lorsque les métriques d’incertitude ne parviennent pas à distinguer la perception de la logique. Ces travaux ouvrent la voie à des méthodes d’inférence et de post-entraînement plus ciblées pour améliorer le raisonnement multimodal, sans s’appuyer uniquement sur des modèles plus grands.
Points clés
- 1.AGS alterne entre raisonnement latent et explicite sans entraînement.
- 2.OPD-V utilise l’équilibre des modalités pour guider l’auto-distillation visuelle.
- 3.Les deux méthodes s’attaquent à la domination du texte dans le raisonnement multimodal.
Des chercheurs ont présenté Attention-Guided Switching, une stratégie d’inférence sans entraînement pour les grands modèles de langage multimodaux, qui utilise un ratio d’attention vision-texte afin de déterminer quand recourir à un raisonnement latent pour les tokens perceptifs et à un raisonnement explicite pour les étapes logiques. Une entrée distincte de HF Daily Papers a décrit OPD-V, une approche d’auto-distillation visuelle on-policy qui traite l’équilibre des modalités comme une information privilégiée et sélectionne les tokens on-policy au moyen d’une région de confiance fondée sur cet équilibre. Le rapport sur OPD-V indique que les expériences couvrent six benchmarks, mais l’extrait source fourni ne contient pas de résultats.
⚡ À tester aujourd'hui
Lisez les articles AGS et OPD-V avant d’ajouter du raisonnement en chaîne ou de l’auto-distillation à des pipelines de raisonnement visuel.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
- arXiv cs.AICorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.AIDASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning ModelsAug 7, 12:00 PM↗
- arXiv cs.LGOn-Policy Self-Distillation without Any SupervisionAug 7, 12:00 PM↗
- arXiv cs.CLCorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLRP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning TransferAug 7, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- HF Daily PapersOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 5, 4:00 AM↗
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
Des chercheurs proposent un modèle de diffusion pour supprimer les reflets dans les vidéos
S2R associe une simulation physique des reflets à un modèle de suppression vidéo par diffusion et à un benchmark.
Un article estime que la sécurité des agents exige des contrats d’exécution
L’article publié sur arXiv affirme que l’alignement au moment de l’entraînement ne suffit pas pour les agents autonomes.
Des chercheurs testent des dispositifs conçus par l’IA pour aider des modèles plus faibles
Un modèle plus puissant a construit, au moment de l’inférence, des échafaudages qui ont amélioré les scores de modèles plus faibles sur des benchmarks de théorie de l’esprit.