PaDoc 提出用于文档解析的并行解码方法
这篇 arXiv 论文介绍了一种 MLLM 解析器,可基于共享的页面表示,对不同区域的内容解码进行分支处理。
为什么重要
文档解析是将多模态模型应用于 PDF、表单和企业记录的核心工作流。PaDoc 瞄准了端到端解析器中的关键效率瓶颈:对彼此独立的页面区域进行串行解码。
核心要点
- 1.PaDoc 在保留整页上下文的同时,并行化区域内容解码。
- 2.该方法采用 masked parallel decoding,并结合 vLLM 后端并发能力。
- 3.论文报告称,PaDoc 在 OmniDocBench Full 上的 Overall layout F1 为 91.1。
研究人员推出了 PaDoc,一种以版面结构为基础的文档解析器。它将预测出的页面布局视为共享页面表示之上的分支结构。该方法旨在让布局流与各个区域内容分支同步推进,把解码深度从完整串行化页面缩短为最长的布局-内容路径。论文报告称,PaDoc 在 OmniDocBench Full 上的 Overall layout F1 达到 91.1。
⚡ 今天就能用
如果要构建依赖串行化 MLLM 输出的高吞吐文档解析流水线,建议先阅读这篇论文。
来源与原始报道
本简报汇总并链接到以下媒体的报道。
觉得这篇简报有用?下一篇直接送到你的邮箱。