PaDoc、文書解析向けに並列デコーディングを提案
arXiv論文は、共有されたページ表現から領域ごとのコンテンツデコーディングを分岐させるMLLMパーサーを説明している。
なぜ重要か
文書解析は、マルチモーダルモデルをPDF、フォーム、企業記録に適用するうえで中核的なワークフローだ。PaDocは、エンドツーエンド型パーサーにおける主要な効率上のボトルネックである、独立したページ領域の直列デコーディングに照準を合わせている。
要点
- 1.PaDocは、ページ全体の文脈を保持しながら、領域ごとのコンテンツデコーディングを並列化する。
- 2.この手法は、vLLMバックエンドの並行処理を用いたマスク付き並列デコーディングを採用している。
- 3.論文では、OmniDocBench FullでOverall layout F1が91.1だったと報告している。
研究者らは、予測されたページレイアウトを共有ページ表現上の分岐構造として扱う、レイアウトに基づく文書パーサー「PaDoc」を発表した。この手法は、レイアウトストリームと領域ごとのコンテンツ分岐を同時に進められるよう設計されており、デコーディングの深さをページ全体の直列化ではなく、最長のレイアウト・コンテンツ経路まで短縮する。論文では、OmniDocBench FullでOverall layout F1が91.1だったと報告している。
⚡ 今日から使える
直列化されたMLLM出力に依存する高スループットの文書解析パイプラインを構築する前に、この論文を読むべきだ。
出典・一次報道
本記事は以下の媒体の報道を要約し、リンクしています。
この記事が役に立ちましたか?次号をメールでお届けします。
関連: 研究
研究
研究者ら、トラックとドローンの配送経路問題「TTP-D」を提案
新たなベンチマークは、品目選択、積載量に応じた経路設計、ドローンとの同期を組み合わせたものだ。
arXiv cs.AI+1 outlet·4h ago
研究
監査・修復の文脈でLLMチェッカーがより寛容になるとの研究結果
arXiv論文は、モデルの文脈内に過去の監査・修復エピソードがあると誤警報が減ると報告している。
arXiv cs.AI+1 outlet·4h ago
研究
AlphaEvolve、行列乗算の上界を引き下げ
新たなarXivノートが、行列乗算指数の上界を改善したと報告した。
arXiv cs.AI+1 outlet·4h ago