AAI News Hub
PesquisaFri, August 7, 2026·5d ago2 sources corroborating

LoT aumenta a precisão em KB-VQA sem treinamento do modelo

O método em tempo de inferência destaca evidências visuais e textuais antes da geração de respostas multimodais.

Por que importa

Os resultados apontam a seleção de evidências em tempo de inferência como uma forma prática de melhorar sistemas multimodais com recuperação aumentada sem retreinar nem alterar a arquitetura do modelo. Isso é relevante para equipes que criam sistemas de QA visual, nos quais recuperações ruidosas e regiões distrativas da imagem podem prejudicar a qualidade das respostas.

Pontos-chave

  • 1.O LoT usa atenção interna para selecionar evidências visuais e textuais.
  • 2.O método não exige atualização de parâmetros nem modelos auxiliares.
  • 3.Os ganhos relatados chegaram a até 12,5 pontos de acurácia nos MLLMs avaliados.

Pesquisadores apresentaram o Look Twice, ou LoT, um framework em tempo de inferência, sem necessidade de treinamento, para resposta visual a perguntas baseada em conhecimento. O LoT usa os próprios padrões de atenção de um modelo multimodal para selecionar regiões da imagem relevantes para a consulta e frases de textos recuperados, filtrar conteúdo distrativo e reformular a entrada com evidências destacadas antes da geração da resposta. Em quatro benchmarks de KB-VQA e 10 modelos multimodais prontos para uso, de 2B a 38B parâmetros, o artigo relata melhorias em todos os backbones avaliados, com ganhos médios de até 12,5 pontos de acurácia.

Experimente hoje

Teste o destaque de evidências ou a reformulação da entrada baseada em atenção antes de fazer fine-tuning em um pipeline de KB-VQA.

Fontes e reportagens originais

Este resumo sintetiza e linka a cobertura dos veículos abaixo.

Gostou deste resumo? Receba o próximo no seu e-mail.

Mais em Pesquisa