PaDoc propõe decodificação paralela para parsing de documentos
O artigo no arXiv descreve um parser MLLM que ramifica a decodificação de conteúdo regional a partir de uma representação compartilhada da página.
Por que importa
O parsing de documentos é um fluxo de trabalho essencial para aplicar modelos multimodais a PDFs, formulários e registros corporativos. O PaDoc mira um gargalo importante de eficiência em parsers de ponta a ponta: a decodificação serial de regiões independentes da página.
Pontos-chave
- 1.O PaDoc mantém o contexto da página inteira enquanto paraleliza a decodificação de conteúdo regional.
- 2.O método usa decodificação paralela mascarada com concorrência no backend vLLM.
- 3.O artigo relata F1 geral de layout de 91,1 no OmniDocBench Full.
Pesquisadores apresentaram o PaDoc, um parser de documentos ancorado em layout que trata o layout de página previsto como uma estrutura de ramificação sobre uma representação compartilhada da página. O método foi projetado para permitir que o fluxo de layout e os ramos de conteúdo regional avancem simultaneamente, reduzindo a profundidade de decodificação ao caminho layout-conteúdo mais longo, em vez de processar a página inteira de forma serializada. O artigo relata um F1 geral de layout de 91,1 no OmniDocBench Full.
⚡ Experimente hoje
Leia o artigo antes de criar pipelines de parsing de documentos de alto volume que dependam de saídas serializadas de MLLM.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores propõem modelo de difusão para remover reflexos em vídeos
O S2R combina simulação física de reflexos com um modelo de difusão para remoção em vídeo e um benchmark.
Artigo defende que a segurança de agentes precisa de contratos em tempo de execução
O artigo no arXiv afirma que o alinhamento durante o treinamento é insuficiente para agentes autônomos.
Pesquisadores testam estruturas criadas por IA para modelos mais fracos
Um modelo mais forte criou scaffolds em tempo de inferência que elevaram as pontuações de modelos mais fracos em benchmarks de Theory-of-Mind.