AAI News Hub
研究Fri, August 7, 2026·Aug 72 sources corroborating

PaDoc、文書解析向けに並列デコーディングを提案

arXiv論文は、共有されたページ表現から領域ごとのコンテンツデコーディングを分岐させるMLLMパーサーを説明している。

なぜ重要か

文書解析は、マルチモーダルモデルをPDF、フォーム、企業記録に適用するうえで中核的なワークフローだ。PaDocは、エンドツーエンド型パーサーにおける主要な効率上のボトルネックである、独立したページ領域の直列デコーディングに照準を合わせている。

要点

  • 1.PaDocは、ページ全体の文脈を保持しながら、領域ごとのコンテンツデコーディングを並列化する。
  • 2.この手法は、vLLMバックエンドの並行処理を用いたマスク付き並列デコーディングを採用している。
  • 3.論文では、OmniDocBench FullでOverall layout F1が91.1だったと報告している。

研究者らは、予測されたページレイアウトを共有ページ表現上の分岐構造として扱う、レイアウトに基づく文書パーサー「PaDoc」を発表した。この手法は、レイアウトストリームと領域ごとのコンテンツ分岐を同時に進められるよう設計されており、デコーディングの深さをページ全体の直列化ではなく、最長のレイアウト・コンテンツ経路まで短縮する。論文では、OmniDocBench FullでOverall layout F1が91.1だったと報告している。

今日から使える

直列化されたMLLM出力に依存する高スループットの文書解析パイプラインを構築する前に、この論文を読むべきだ。

出典・一次報道

本記事は以下の媒体の報道を要約し、リンクしています。

この記事が役に立ちましたか?次号をメールでお届けします。

関連: 研究