LoT aumenta a precisão em KB-VQA sem treinamento do modelo
O método em tempo de inferência destaca evidências visuais e textuais antes da geração de respostas multimodais.
Por que importa
Os resultados apontam a seleção de evidências em tempo de inferência como uma forma prática de melhorar sistemas multimodais com recuperação aumentada sem retreinar nem alterar a arquitetura do modelo. Isso é relevante para equipes que criam sistemas de QA visual, nos quais recuperações ruidosas e regiões distrativas da imagem podem prejudicar a qualidade das respostas.
Pontos-chave
- 1.O LoT usa atenção interna para selecionar evidências visuais e textuais.
- 2.O método não exige atualização de parâmetros nem modelos auxiliares.
- 3.Os ganhos relatados chegaram a até 12,5 pontos de acurácia nos MLLMs avaliados.
Pesquisadores apresentaram o Look Twice, ou LoT, um framework em tempo de inferência, sem necessidade de treinamento, para resposta visual a perguntas baseada em conhecimento. O LoT usa os próprios padrões de atenção de um modelo multimodal para selecionar regiões da imagem relevantes para a consulta e frases de textos recuperados, filtrar conteúdo distrativo e reformular a entrada com evidências destacadas antes da geração da resposta. Em quatro benchmarks de KB-VQA e 10 modelos multimodais prontos para uso, de 2B a 38B parâmetros, o artigo relata melhorias em todos os backbones avaliados, com ganhos médios de até 12,5 pontos de acurácia.
⚡ Experimente hoje
Teste o destaque de evidências ou a reformulação da entrada baseada em atenção antes de fazer fine-tuning em um pipeline de KB-VQA.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.AILook Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question AnsweringAug 7, 12:00 PM↗
- arXiv cs.CLLook Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question AnsweringAug 7, 12:00 PM↗
- arXiv cs.CLUniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question AnsweringAug 6, 12:00 PM↗
- arXiv cs.CLRepresenting Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native ModelingAug 6, 12:00 PM↗
- arXiv cs.AIPerception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question AnsweringAug 6, 12:00 PM↗
- HF Daily PapersChronoVision: Temporal Reasoning via Latent State ReconstructionAug 6, 4:00 AM↗
- arXiv cs.AIWhen and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video UnderstandingAug 5, 12:00 PM↗
- arXiv cs.AICURV: Enhancing Chart Understanding Through Curriculum Visual Grounded ReasoningAug 5, 12:00 PM↗
- arXiv cs.CLCURV: Enhancing Chart Understanding Through Curriculum Visual Grounded ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGBayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question AnsweringAug 5, 12:00 PM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Equipe MiLMMT lança modelos de tradução sem referência
O MiLMMT-46-v1.0 usa GRPO e interpolação de checkpoints para aprimorar a tradução multilíngue aberta.
DistilVDR comprime a recuperação visual de documentos
O recuperador de 524 milhões de parâmetros usa destilação bilateral a partir de um professor visão-linguagem de 8B.
Pesquisadores propõem Power Law Graph Attention
PLGA generaliza a atenção por produto escalar escalonado e relata colapso de inferência sob invariância exata.