新论文聚焦长文档 VLM 推理
InSight-doc、DocAtlas 和 DocMemo 提出以智能体方式在复杂文档中寻找证据。
为什么重要
这些论文反映出一个更广泛的趋势:文档 AI 系统正转向更具智能体特征、主动寻找证据的形态,在推理过程中管理上下文、记忆和视觉细节。这对 VLM 在报告、申报文件、手册以及其他篇幅较长、版式复杂的文档中的实际应用可能很重要,因为静态 top-k 检索可能会漏掉稀疏分布的证据。
核心要点
- 1.InSight-doc 无需外部检索器即可自适应放大文档区域。
- 2.该 8B 模型报告称 VQA 准确率更高、幻觉更少、延迟更低。
- 3.DocAtlas 和 DocMemo 强调可变状态与记忆引导的证据发现。
多篇新的 arXiv 论文提出了面向长文档理解的系统,试图超越对视觉信息丰富页面的静态检索。InSight-doc 将图像分辨率视为推理时可自适应调配的资源:先从低分辨率开始,再有选择地放大到相关区域寻找证据;其 8B 模型将文档 VQA 准确率提升了 4.3 到 16.4 个百分点,在长文档上的幻觉减少超过 40%,延迟降低 41% 到 68%。DocAtlas 将文档问答建模为一种带有可变状态的交互过程,配备搜索、阅读、记笔记和复核工具;DocMemo 则提出利用文档、页面和问题级记忆来引导动态证据探索。
⚡ 今天就能用
在扩大上下文窗口或页面预算之前,先用 InSight-doc 这类智能体式文档工作流,在长篇、视觉信息丰富的 PDF 上对照评估你现有的 RAG 流水线。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
- arXiv cs.LGInSight-doc: Agentic Visual Perception for Long-Document UnderstandingAug 12, 12:00 PM↗
- arXiv cs.CLInSight-doc: Agentic Visual Perception for Long-Document UnderstandingAug 12, 12:00 PM↗
- arXiv cs.CLDocAtlas: Long-Document Understanding as Mutable-State InteractionAug 11, 12:00 PM↗
- arXiv cs.AIDocAtlas: Long-Document Understanding as Mutable-State InteractionAug 11, 12:00 PM↗
- HF Daily PapersInSight-doc: Agentic Visual Perception for Long-Document UnderstandingAug 11, 4:00 AM↗
- arXiv cs.AIDocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document UnderstandingAug 10, 12:00 PM↗
- arXiv cs.CLDocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document UnderstandingAug 10, 12:00 PM↗
觉得这篇简报有用?下一篇直接送到你的邮箱。