Artículos apuntan al equilibrio de modalidades en el razonamiento de los MLLM
Dos nuevos métodos buscan mejorar el razonamiento visual gestionando cómo los modelos usan las señales de imagen y texto.
Por qué importa
Ambos informes se centran en un problema clave de los MLLM: el razonamiento visual puede degradarse cuando domina la generación de texto o cuando las métricas de incertidumbre no logran separar percepción y lógica. El trabajo apunta a métodos de inferencia y posentrenamiento más específicos para mejorar el razonamiento multimodal sin depender solo de modelos más grandes.
Puntos clave
- 1.AGS alterna entre razonamiento latente y explícito sin entrenamiento.
- 2.OPD-V usa el equilibrio de modalidades para guiar la autodestilación visual.
- 3.Ambos métodos abordan el dominio del texto en el razonamiento multimodal.
Investigadores describieron Attention-Guided Switching, una estrategia de inferencia sin entrenamiento para modelos de lenguaje grandes multimodales que usa una proporción de atención de visión a texto para decidir cuándo emplear razonamiento latente en tokens perceptivos y razonamiento explícito en pasos lógicos. Una entrada separada de HF Daily Papers describió OPD-V, un enfoque visual de autodestilación on-policy que trata el equilibrio de modalidades como información privilegiada y selecciona tokens on-policy mediante una región de confianza basada en ese equilibrio. El informe de OPD-V señala que los experimentos abarcan seis benchmarks, pero el fragmento de fuente proporcionado no incluye resultados.
⚡ Pruébalo hoy
Lee los artículos de AGS y OPD-V antes de añadir cadena de pensamiento o autodestilación a pipelines de razonamiento visual.
Fuentes y cobertura original
Este resumen sintetiza y enlaza la cobertura de los medios siguientes.
- arXiv cs.AICorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.AIDASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning ModelsAug 7, 12:00 PM↗
- arXiv cs.LGOn-Policy Self-Distillation without Any SupervisionAug 7, 12:00 PM↗
- arXiv cs.CLCorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLRP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning TransferAug 7, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- HF Daily PapersOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 5, 4:00 AM↗
¿Te gustó este resumen? Recibe el próximo en tu correo.
Más en Investigación
Investigadores proponen un modelo de difusión para eliminar reflejos en video
S2R combina una simulación física de reflejos con un modelo de difusión para eliminar reflejos en video y un benchmark.
Un artículo sostiene que la seguridad de los agentes necesita contratos en tiempo de ejecución
El artículo en arXiv afirma que la alineación durante el entrenamiento no basta para los agentes autónomos.
Investigadores prueban arneses creados por IA para modelos más débiles
Un modelo más potente construyó estructuras de inferencia que elevaron las puntuaciones de modelos más débiles en benchmarks de Teoría de la Mente.