DistilVDR comprime a recuperação visual de documentos
O recuperador de 524 milhões de parâmetros usa destilação bilateral a partir de um professor visão-linguagem de 8B.
Por que importa
O trabalho mira um gargalo prático na recuperação visual de documentos: o custo de indexar e servir sistemas com múltiplos bilhões de parâmetros ou multivetoriais em escala de corpus. Ele sugere que modelos VDR compactos de vetor único podem preservar boa parte da qualidade de recuperação de um professor maior, com requisitos de serving mais simples.
Pontos-chave
- 1.O DistilVDR é um sistema VDR ponta a ponta de 524 milhões de parâmetros.
- 2.O treinamento usa apenas o espaço de embeddings do professor congelado.
- 3.A variante HiRes atinge NDCG@5 médio de 61,74 no ViDoRe v1+v2+v3.
Pesquisadores apresentaram o DistilVDR, um sistema ponta a ponta de recuperação visual de documentos com 524 milhões de parâmetros, destilado de um professor visão-linguagem congelado de 8B. O sistema usa uma configuração compacta de codificadores assimétricos, incluindo um lado de consulta com 70 milhões de parâmetros, e não exige rótulos de relevância, amostragem negativa nem termo contrastivo para treinar o aluno. Sua variante HiRes reporta NDCG@5 médio de 61,74 no ViDoRe v1+v2+v3, equivalente a 86,9% do professor, e lidera os baselines sub-1B reproduzidos no benchmark v3.
⚡ Experimente hoje
Leia o paper do DistilVDR antes de escolher um modelo VDR grande para cargas de trabalho de busca em documentos.
Fontes e reportagens originais
Este resumo sintetiza e linka a cobertura dos veículos abaixo.
- arXiv cs.CLDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 12, 12:00 PM↗
- arXiv cs.CLAnchorFold: A Focus-Then-Fold Framework via Recursive Attention Propagation for Efficient Multi-Vector Visual Document RetrievalAug 11, 12:00 PM↗
- HF Daily PapersDistilVDR: A Compact End-to-End Visual Document Retriever via Dual-Student DistillationAug 11, 4:00 AM↗
Gostou deste resumo? Receba o próximo no seu e-mail.
Mais em Pesquisa
Pesquisadores miram lacunas de raciocínio espacial em VLMs
Novos artigos propõem memória, RL e benchmarks para inteligência espacial em sistemas de visão-linguagem.
Novos estudos investigam inteligência espacial em IA de visão
SpaRRTa, SMA e PinpointQA testam ou aprimoram o raciocínio espacial em sistemas de IA visual e incorporada.
CW-BASS v2 mira a seleção de pseudo-rótulos com DINOv2
O método adapta a filtragem para segmentação semissupervisionada com professores baseados em modelos de fundação.