LoT 无需训练模型即可提升 KB-VQA 准确率
这种推理时方法会在多模态生成答案前突出视觉与文本证据。
为什么重要
结果表明,在推理阶段进行证据选择,是一种无需重新训练或改变模型架构就能改进检索增强多模态系统的实用方法。这对构建视觉问答系统的团队具有现实意义,因为嘈杂的检索结果和分散注意力的图像区域都可能削弱答案质量。
核心要点
- 1.LoT 使用内部注意力来选择视觉和文本证据。
- 2.该方法不需要更新参数,也不需要辅助模型。
- 3.论文报告称,在评估的 MLLM 中,准确率提升最高达到 12.5 个百分点。
研究人员提出了 Look Twice(LoT),一个面向知识型视觉问答(KB-VQA)的免训练推理时框架。LoT 利用多模态模型自身的注意力模式,选择与查询相关的图像区域和检索到的文本句子,过滤干扰内容,并在生成答案前用高亮证据重新组织输入。论文称,在四个 KB-VQA 基准和 10 个现成多模态模型上,从 2B 到 38B 参数规模,LoT 让所有评估的骨干模型都取得提升,平均增幅最高达 12.5 个准确率百分点。
⚡ 今天就能用
在微调 KB-VQA 流水线之前,先测试证据高亮或基于注意力的输入重构方法。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.AILook Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question AnsweringAug 7, 12:00 PM↗
- arXiv cs.CLLook Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question AnsweringAug 7, 12:00 PM↗
- arXiv cs.CLUniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question AnsweringAug 6, 12:00 PM↗
- arXiv cs.CLRepresenting Visual Evidence for Item Difficulty Prediction: Visual Textualization and Image-Native ModelingAug 6, 12:00 PM↗
- arXiv cs.AIPerception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question AnsweringAug 6, 12:00 PM↗
- HF Daily PapersChronoVision: Temporal Reasoning via Latent State ReconstructionAug 6, 4:00 AM↗
- arXiv cs.AIWhen and Where to Look: Adaptive Visual Evidence Scheduling for Efficient Long Video UnderstandingAug 5, 12:00 PM↗
- arXiv cs.AICURV: Enhancing Chart Understanding Through Curriculum Visual Grounded ReasoningAug 5, 12:00 PM↗
- arXiv cs.CLCURV: Enhancing Chart Understanding Through Curriculum Visual Grounded ReasoningAug 5, 12:00 PM↗
- arXiv cs.LGBayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question AnsweringAug 5, 12:00 PM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。