Artigos miram o equilíbrio entre modalidades no raciocínio de MLLMs
Dois novos métodos buscam melhorar o raciocínio visual ao gerenciar como os modelos usam sinais de imagem e texto.
Por que importa
Ambos os relatórios se concentram em um problema central dos MLLMs: o raciocínio visual pode se deteriorar quando a geração de texto domina ou quando métricas de incerteza não conseguem separar percepção de lógica. Os trabalhos apontam para métodos mais direcionados de inferência e pós-treinamento para melhorar o raciocínio multimodal sem depender apenas de modelos maiores.
Pontos-chave
- 1.O AGS alterna entre raciocínio latente e explícito sem treinamento.
- 2.O OPD-V usa o equilíbrio entre modalidades para orientar a autodestilação visual.
- 3.Ambos os métodos enfrentam a dominância do texto no raciocínio multimodal.
Pesquisadores descreveram o Attention-Guided Switching, uma estratégia de inferência sem treinamento para grandes modelos de linguagem multimodais que usa uma razão de atenção entre visão e texto para decidir quando recorrer ao raciocínio latente para tokens perceptivos e ao raciocínio explícito para etapas lógicas. Uma entrada separada do HF Daily Papers descreveu o OPD-V, uma abordagem visual de autodestilação on-policy que trata o equilíbrio entre modalidades como informação privilegiada e seleciona tokens on-policy por meio de uma região de confiança baseada nesse equilíbrio. O relatório sobre o OPD-V afirma que os experimentos abrangem seis benchmarks, mas o trecho da fonte fornecida não inclui resultados.
⚡ Experimente hoje
Leia os artigos sobre AGS e OPD-V antes de adicionar chain-of-thought ou autodestilação a pipelines de raciocínio visual.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AICorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.AIDASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning ModelsAug 7, 12:00 PM↗
- arXiv cs.LGOn-Policy Self-Distillation without Any SupervisionAug 7, 12:00 PM↗
- arXiv cs.CLCorrect Answers from Sound Reasoning: Verifiable Process Supervision for Language ModelsAug 7, 12:00 PM↗
- arXiv cs.CLRP-OPSD: Reasoning-Pivot-Guided On-Policy Self-Distillation for Multilingual Reasoning TransferAug 7, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.CLInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.AIOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 6, 12:00 PM↗
- arXiv cs.LGInstruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned PolicyAug 6, 12:00 PM↗
- arXiv cs.LGReward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement LearningAug 6, 12:00 PM↗
- HF Daily PapersOPD-V: Visual On-Policy Self-Distillation with Modality BalanceAug 5, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Equipe MiLMMT lança modelos de tradução sem referência
O MiLMMT-46-v1.0 usa GRPO e interpolação de checkpoints para aprimorar a tradução multilíngue aberta.
DistilVDR comprime a recuperação visual de documentos
O recuperador de 524 milhões de parâmetros usa destilação bilateral a partir de um professor visão-linguagem de 8B.
Pesquisadores propõem Power Law Graph Attention
PLGA generaliza a atenção por produto escalar escalonado e relata colapso de inferência sob invariância exata.