PaDoc propose un décodage parallèle pour l’analyse de documents
L’article publié sur arXiv décrit un parseur MLLM qui fait dériver le décodage du contenu régional d’une représentation partagée de la page.
Pourquoi c'est important
L’analyse de documents est un workflow central pour appliquer les modèles multimodaux aux PDF, aux formulaires et aux dossiers d’entreprise. PaDoc cible un goulot d’étranglement majeur des parseurs de bout en bout : le décodage sériel de régions de page indépendantes.
Points clés
- 1.PaDoc conserve le contexte de la page entière tout en parallélisant le décodage du contenu régional.
- 2.La méthode utilise un décodage parallèle masqué avec concurrence via le backend vLLM.
- 3.L’article rapporte un F1 global de mise en page de 91,1 sur OmniDocBench Full.
Des chercheurs ont présenté PaDoc, un parseur de documents ancré dans la mise en page, qui traite la mise en page prédite comme une structure de branchement au-dessus d’une représentation partagée de la page. La méthode vise à permettre au flux de mise en page et aux branches de contenu régional d’avancer simultanément, réduisant la profondeur de décodage au plus long chemin mise en page-contenu plutôt qu’à l’ensemble de la page sérialisée. L’article rapporte un F1 global de mise en page de 91,1 sur OmniDocBench Full.
⚡ À tester aujourd'hui
Lisez l’article avant de construire des pipelines d’analyse de documents à haut débit qui dépendent de sorties MLLM sérialisées.
Sources et articles originaux
Ce brief résume et renvoie vers la couverture des médias ci-dessous.
Ce brief vous a plu ? Recevez le prochain par e-mail.
Plus dans Recherche
L’équipe MiLMMT publie des modèles de traduction sans référence
MiLMMT-46-v1.0 utilise GRPO et l’interpolation de checkpoints pour améliorer la traduction multilingue ouverte.
DistilVDR compresse la recherche visuelle de documents
Ce moteur de recherche à 524 millions de paramètres utilise une distillation bilatérale à partir d’un modèle enseignant vision-langage de 8 milliards de paramètres.
Des chercheurs proposent Power Law Graph Attention
PLGA généralise l’attention par produit scalaire mis à l’échelle et rapporte un effondrement de l’inférence sous invariance exacte.